六西格玛数据类型怎么分?从定性、定量到四种测量尺度完整解析

六西格玛项目进入数据分析阶段后,很多人会急着选择控制图、假设检验或回归模型,却忽略了一个更基础的问题:手上的数据究竟属于什么类型?

同样是数字,「产品直径10.02毫米」「缺陷数量4个」和「满意度等级4分」代表的含义完全不同。直径可以测量到更细的小数,缺陷数量只能逐个计算,满意度中的4则主要代表一个有顺序的等级。三者虽然都用数字记录,允许进行的数学运算和统计分析却并不相同。

数据类型判断错误,后面的分析工具也容易选错。例如,把供应商编号当作连续数值计算平均值,把通过与不通过的数据放进普通ANOVA,或者对每件产品的缺陷数量使用不合适的控制图,都可能得出没有意义的结果。

要把数据类型真正弄清楚,不能只背诵Nominal、Ordinal、Interval和Ratio四个名称。更实用的做法,是从三个不同角度观察数据:

  • 数据表达的是类别,还是数量;
  • 数据处于哪一种测量尺度;
  • 数据在质量管理中属于属性、计数还是连续测量。

这些分类之间会有交叉,但回答的问题不同。只有把它们分开理解,才能正确选择图表、描述统计、控制图和假设检验。

数据分类为什么看起来总是互相矛盾?

学习统计时,我们会看到定性与定量、属性与变量、离散与连续,以及四种测量尺度等多套分类。有人会因此产生疑问:一个数据到底只能属于一种类别,还是可以同时拥有多个名称?

答案是:同一组数据可以从不同角度分类。

例如「每件产品的缺陷数量」:

  • 它用数字表示数量,因此属于定量数据;
  • 它通过计数得到,因此属于离散数据;
  • 在质量管理中,它通常归入属性数据;
  • 零个缺陷代表没有缺陷,比例也可以解释,因此通常具有等比尺度特征。

这些说法并不冲突,只是分类角度不同。

再看「客户满意度:非常不满意、不满意、一般、满意、非常满意」:

  • 它表达类别和等级,因此通常归入定性数据;
  • 类别有明确顺序,所以属于等级尺度;
  • 即使编码成1至5,也不会自动变成连续变量;
  • 在某些统计模型中,可以根据量表设计把多题总分近似当作连续数据处理,但需要说明分析假设。

所以,判断数据类型不是为数据贴上唯一标签,而是确认它携带哪些信息,以及准备怎样使用。

第一种分类:定性数据和定量数据

从最基本的表现形式来看,数据可以分为定性数据和定量数据。

定性数据:说明对象属于哪一类

定性数据(Qualitative Data)也常称为类别数据,主要描述对象的属性、状态、类型或等级。

例如工厂分析客户投诉时,可能记录:

  • 投诉类型:外观、尺寸、功能、包装;
  • 责任环节:设计、采购、生产、运输;
  • 供应商:A、B、C;
  • 产品状态:合格、不合格;
  • 严重程度:轻微、一般、严重。

这些数据主要回答「是什么」或「属于哪一类」,不直接表示一个可以进行普通加减乘除的数量。

定量数据:说明有多少或相差多少

定量数据(Quantitative Data)使用数值表示数量、大小、时间、距离、强度或其他可以计算的结果。

例如:

  • 轴径:10.024毫米;
  • 产品重量:502.6克;
  • 生产周期:42.8秒;
  • 拉伸强度:580 MPa;
  • 客户等待时间:18.5分钟;
  • 每批不良品数量:12件。

不过,定量数据不一定都是连续测量值。每批有12件不良品同样是数字,却属于计数结果。要决定采用什么分析方法,还要继续判断它是离散数据还是连续数据。

第二种分类:四种测量尺度

测量尺度(Scale of Measurement)关注的不是数据长得像文字还是数字,而是数据包含多少数学信息。经典分类包括:

  • 名目尺度(Nominal);
  • 等级尺度(Ordinal);
  • 等距尺度(Interval);
  • 等比尺度(Ratio)。
测量尺度 能够分类 能够排序 差值可解释 比例可解释 常见示例
名目尺度 供应商、颜色、缺陷类型
等级尺度 通常不能准确解释 满意度、风险等级、严重程度
等距尺度 摄氏温度、日历年份
等比尺度 重量、长度、时间、数量

四种尺度从上至下通常包含越来越多的信息,但这不代表下面的尺度必然比上面的尺度更重要。一个名目型客户要求同样可能决定产品能否被接受。

名目尺度:数字也可能只是一张标签

名目尺度(Nominal Scale)只负责区分类别,类别之间没有天然的顺序关系。

常见例子包括:

  • 产品颜色:黑、白、红;
  • 供应商:A、B、C;
  • 缺陷类型:划伤、破损、污染;
  • 班次:早班、中班、夜班;
  • 产品结果:合格、不合格。

为了方便输入软件,企业经常把类别编码成数字。例如:

合格 = 0,不合格 = 1

这里的0和1只是代码。1不代表比0多一个单位,也不能据此说不合格是合格的某种倍数。

同样地,若把三个供应商编码为:

供应商A = 1,供应商B = 2,供应商C = 3

计算「平均供应商编号」通常没有业务意义。编号3也不代表供应商C的表现是供应商A的三倍。

名目数据常用的分析包括:

  • 频数和百分比;
  • 众数;
  • 条形图和柏拉图;
  • 列联表;
  • 卡方检验;
  • 二项或多项分类模型。

对于二分类结果,还可以分析不良率、通过率或发生概率。不过,即使编码为0和1,也要记住其本质仍然是类别结果。

等级尺度:知道高低,却不知道相差多远

等级尺度(Ordinal Scale)比名目尺度多了一项信息:类别之间具有明确顺序。

例如:

  • 风险等级:低、中、高;
  • 缺陷严重度:轻微、主要、严重;
  • 教育程度:中学、大学、硕士、博士;
  • 客户评价:非常不满意、不满意、一般、满意、非常满意。

这些类别可以排序,但相邻等级之间的距离未必相等。

假设客户满意度编码为:

1 = 非常不满意,2 = 不满意,3 = 一般,4 = 满意,5 = 非常满意

我们知道5代表的满意程度高于4,4又高于3。但不能直接证明「非常不满意」到「不满意」的心理差距,与「满意」到「非常满意」完全相等。

这也是为什么单题Likert量表通常首先被视为等级数据。给类别编上1至5,只是方便排序和计算,不会自动让它具有真正的等距或等比性质。

等级数据常用的分析包括:

  • 频数和累积百分比;
  • 中位数和百分位数;
  • 秩和相关分析;
  • Mann-Whitney、Kruskal-Wallis等非参数检验;
  • 有序Logistic回归。

在实际研究中,多道设计良好的Likert题目可能被组合成一个量表总分,并在满足一定条件时近似作为连续变量分析。但这种做法需要结合量表设计、样本量、分布和模型稳健性判断,不能只因为数据是1至5便直接套用所有连续数据方法。

等距尺度:差多少有意义,多少倍却没有意义

等距尺度(Interval Scale)具有顺序,并且相邻数值之间的距离可以一致解释。

摄氏温度是最常见的例子:

  • 10℃到20℃相差10℃;
  • 20℃到30℃也相差10℃。

两个10℃的差距具有相同含义,因此可以计算和比较温差。

但是,0℃并不代表完全没有温度。摄氏温标的零点是人为设定的参考点,所以不能说20℃是10℃的「两倍热」。

日历年份也具有类似性质。2000年至2010年相隔10年,2010年至2020年也相隔10年,但不能说2020年是1010年的两倍。

等距数据可以进行许多常见统计运算,包括平均值、标准差、相关和回归。不过,涉及「几倍」的比例解释通常不成立。

等比尺度:零点、差值和比例都有实际意义

等比尺度(Ratio Scale)具备分类、排序、相等间距和有意义的绝对零点,因此允许解释差值和比例。

常见例子包括:

  • 长度和直径;
  • 重量;
  • 加工时间;
  • 运输距离;
  • 产量和销售数量;
  • 缺陷数量;
  • 绝对温标中的温度。

假设两个产品分别重100克和200克,我们既可以说第二个产品多100克,也可以说它是第一个产品的两倍重。

200 ÷ 100 = 2

这种比例能够解释,是因为0克确实代表没有这部分重量。

等比尺度通常允许使用最完整的算术和统计分析,但是否选择某种方法,还要检查数据分布、样本独立性、测量系统、模型假设和研究目的。

测量尺度不是统计方法的唯一决定因素

四种测量尺度有助于理解数据能够表达什么,但不能单凭尺度名称机械地选择统计工具。

例如,直径和交付时间都属于等比尺度,但直径可能近似对称分布,交付时间却经常明显右偏。两者即使尺度相同,也未必适合使用完全相同的模型。

选择方法时还要考虑:

  • 数据是结果Y还是解释因素X;
  • 数据是独立样本还是配对、重复测量;
  • 数据分布是否符合模型要求;
  • 样本量是否足够;
  • 是否存在删失、零值过多或异常值;
  • 研究目标是比较、预测、分类还是过程监控。

因此,「测量尺度决定统计方法」是一种入门层面的简化说法。更准确的表达是:测量尺度决定哪些运算和解释具有意义,并限制可以合理使用的分析方法。

第三种分类:属性数据与变量数据

在六西格玛、质量管理和SPC中,数据还经常被分成属性数据(Attribute Data)和变量数据(Variable Data)。

属性数据包括分类结果和计数结果

属性数据常见形式包括:

  • 合格或不合格;
  • 有缺陷或无缺陷;
  • 缺陷类型;
  • 每件产品发现多少个缺陷;
  • 一批产品中有多少件不良品。

属性数据内部还要区分两种概念:

  • 不良品(Defective Unit):一件产品是否属于不合格;
  • 缺陷(Defect):一件产品上出现多少项不符合。

一件产品可以只有一个不良品结果,却可能同时存在多个缺陷。例如一辆汽车被判定为不合格,是一个不良品;车身划伤、车灯失效和座椅破损,则是三个缺陷。

这一区别会直接影响属性控制图的选择。

变量数据通常通过测量得到

变量数据是使用测量仪器或记录系统获得的数值,例如:

  • 轴径10.018毫米;
  • 重量501.6克;
  • 反应时间38.4秒;
  • 拉伸强度582 MPa;
  • 室内温度24.6℃。

变量数据通常能保留较多过程信息。例如,两件产品都判定为合格,但一件尺寸位于目标附近,另一件已经接近规格上限。合格与不合格只保留最终分类,实际尺寸则保留了偏离目标的程度。

离散数据与连续数据又有什么区别?

定量数据可以进一步分为离散数据和连续数据。

离散数据通常是数出来的

离散数据(Discrete Data)只能取某些分开的数值,最常见的是整数计数。

例如:

  • 今天收到12宗客户投诉;
  • 一批产品发现8件不良品;
  • 一件产品上存在3处缺陷;
  • 一小时生产48件产品。

在这些情况下,不会出现3.7宗投诉或2.4处缺陷。数据虽然是数字,却不是连续测量值。

连续数据通常是量出来的

连续数据(Continuous Data)理论上可以在某个范围内取任意数值,精度主要受到测量仪器限制。

例如:

  • 直径20.016毫米;
  • 重量12.382千克;
  • 加工时间35.728秒;
  • 温度82.56℃。

如果使用分辨率更高的仪器,还可以继续记录更多小数。

所以,看到数字时不能立即认定它是连续数据。数量4是离散计数,尺寸4.00毫米则可能是连续测量结果。关键在于数据是怎样产生的。

属性、变量、离散和连续之间怎样对应?

数据示例 主要形式 离散或连续 质量管理分类
合格/不合格 类别 离散 属性数据
缺陷类型 类别 离散 属性数据
不良品数量 计数 离散 属性数据
每件产品缺陷数 计数 离散 属性数据
产品直径 测量值 连续 变量数据
加工时间 测量值 连续 变量数据

在传统质量管理术语中,计数数据经常被归入属性数据,尽管它同时也是定量和离散数据。这正说明不同分类体系关注的角度并不相同。

为什么六西格玛倾向保留连续数据?

如果同一个过程结果既可以记录为连续测量值,也可以压缩成合格与不合格,连续数据通常能够保留更多信息。

例如一家企业要求订单在48小时内交付。企业可以采用两种记录方法。

第一种方法只记录:

准时 = 0,迟交 = 1

这种数据可以计算准时率和迟交率,却看不到订单究竟提前或延迟了多少。

第二种方法记录每张订单的实际交付时间,例如:

25.4小时、38.2小时、47.6小时、52.1小时、76.8小时

这组数据除了能够判断是否超过48小时,还可以研究:

  • 平均和中位交付时间;
  • 过程变异和分布形态;
  • 订单之间的差异;
  • 哪些订单类型更容易延误;
  • 改善前后的时间变化;
  • 过程满足48小时要求的能力。

如果企业一开始便把交付时间压缩成准时和迟交,许多过程信息会永久消失。

不过,连续数据只有在测量可靠时才有优势。若时间起点和终点定义不一致,或者不同部门采用不同记录规则,数据精细到小数点后两位也没有实际价值。

名目数据不低级,它可能直接决定客户是否接受

把四种尺度排列以后,人们容易误以为等比尺度最高级,名目尺度最低级。实际上,信息量较少不等于业务重要性较低。

假设客户订购一辆黑色汽车。工厂生产出来的车辆在长度、重量、动力、油耗和安全测试方面全部符合要求,却把车身做成白色。

「黑色」和「白色」属于名目数据,没有大小顺序,也不能计算平均值。但是颜色是订单中的关键要求,做错以后客户完全可能拒收。

因此,数据价值不取决于能够进行多少数学运算,而取决于它是否正确反映客户重视的CTQ关键质量特性。

六西格玛项目不应为了使用复杂统计方法,强行把所有需求转化为连续数据。客户要求是什么,就应该采用能够真实描述该要求的数据。

数据类型如何影响SPC控制图的选择?

在SPC中,变量数据与属性数据使用不同的控制图。即使都属于属性数据,也要区分记录的是不良品还是缺陷,以及每次检查的机会是否相同。

数据和取样情况 常用控制图
连续数据,每组有多个观测值,子组较小 X̄-R图
连续数据,每组有多个观测值,子组较大 X̄-S图
连续数据,每次只有一个观测值 I-MR图
不良品比例,样本量可变化 p图
不良品数量,样本量固定 np图
缺陷数量,检验机会固定 c图
单位缺陷数,检验机会可变化 u图

例如每天检查100件产品并记录不良品数量,可以考虑np图;如果每天抽样数量不同,则通常使用p图。若记录的是每件产品表面发现多少处缺陷,而不是有多少件不良品,则需要考虑c图或u图。

控制图选择错误,不只是图表名称不准确,还会导致控制限计算和异常判断出现问题。

数据类型怎样影响假设检验?

假设检验的选择会受到结果变量Y、解释变量X、样本结构和分布条件共同影响。

例如企业想比较三家供应商的表现。

结果Y是连续尺寸

如果Y是产品直径,X是供应商A、B、C,团队可能比较三家供应商的平均直径或整体分布。若数据结构和模型条件合适,可以考虑单因子ANOVA;如果相关条件不适合,也可能使用非参数方法或其他模型。

结果Y是合格或不合格

如果Y变成二分类结果,团队关注的便是三家供应商的不良率是否不同。这时可能使用列联表、卡方检验、Fisher精确检验或二项Logistic回归,而不是原封不动地使用连续数据ANOVA。

结果Y是缺陷数量

如果Y是每批发现的缺陷数量,分析就需要考虑计数数据的特性,以及每批产品数量或缺陷机会是否相同。某些情况下可采用Poisson或负二项模型。

结果Y是有序等级

如果Y是供应商评价的低、中、高等级,则可能采用秩检验或有序分类模型。

所以开始分析以前,团队应该先确认:

  • Y是什么类型的数据;
  • X是什么类型的数据;
  • 样本之间是否独立;
  • 研究目标是比较差异还是建立预测关系。

这一步做清楚以后,统计方法的选择范围通常会明显缩小。

数字编码不会改变数据的本质

数据分析中一个常见错误,是认为只要把类别转换成数字,就可以按照连续数据处理。

例如把三个地区编码为:

华东 = 1,华南 = 2,华北 = 3

这些数字只是方便软件识别,不能计算平均地区,也不能把地区3解释为地区1的三倍。

类似地,设备编号101、102和103虽然由数字组成,本质上仍然是名目数据。员工编号、订单编号、邮政编码和产品代码也属于同样情况。

判断数据类型时,应看数字代表的业务含义,而不是看单元格里是否出现阿拉伯数字。

百分比也不一定属于同一种分析情境

百分比看起来都是连续数值,但来源可能完全不同。

例如:

  • 一批100件产品中有5件不良,不良率为5%;
  • 设备当月可动率为95%;
  • 员工问卷平均满意比例为80%;
  • 材料中某成分占比为5%。

这些数据虽然都以百分比表示,但生成机制、分母和统计性质不同。第一项来自二项计数,第二项与时间构成有关,第三项可能来自问卷汇总,第四项则是连续成分比例。

不能只看到百分号,便认定它们适用相同的控制图或假设检验。

不要为了获得更多数据,把连续变量重复二分

企业经常把原本的连续测量结果转成通过与不通过,以便计算合格率。这种转换对产品放行有实际意义,但如果分析阶段只保留分类结果,会损失大量信息。

例如轴径规格为10.00±0.05毫米,9.951毫米和10.049毫米都被判定为合格。二分类结果看不到它们分别接近不同规格边界,也无法观察过程中心是否正在漂移。

较好的数据管理方式,是保留原始测量值,同时根据需要增加规格判定字段:

轴径 规格判定
9.951毫米 合格
10.002毫米 合格
10.049毫米 合格
10.056毫米 不合格

这样既能满足放行管理,也能保留过程分析所需的信息。

数据精度越高,不代表数据质量越好

六西格玛重视数据,但精确的小数位数不等于可靠的测量结果。

一把分辨率不足的量具,即使系统显示六位小数,也不代表结果真的具备六位小数的精度。不同操作员如果采用不同测量位置,数据看起来详细,实际变异却可能来自测量方法。

在收集连续数据前,应考虑:

  • 测量系统的分辨率是否足够;
  • 操作定义是否清楚;
  • 重复性和再现性是否可以接受;
  • 测量过程是否稳定;
  • 数据记录和转换是否可能出错。

如果测量系统不可靠,把类别数据换成更细的连续数值不会自动改善分析,反而可能产生虚假的精确感。

四种测量尺度怎样快速判断?

面对一项新数据时,可以依次提出四个问题。

问题一:数据只是用来区分类别吗?

如果数据只能说明对象属于哪一类,而且类别没有天然顺序,通常属于名目尺度。

例如:红色、黄色、蓝色。

问题二:类别之间有明确顺序吗?

如果可以排序,但相邻等级之间的距离不能准确解释,通常属于等级尺度。

例如:差、一般、良好、优秀。

问题三:数值之间的差距是否具有一致含义?

如果增加一个单位在不同位置代表相同差距,数据可能属于等距或等比尺度。

例如摄氏温度中的10℃差距。

问题四:零点是否代表真正的「没有」?

如果零点具有实际意义,而且两倍、三倍等比例能够解释,通常属于等比尺度。若差值有意义,但零点只是人为参考点,则通常属于等距尺度。

名目:只能分类
等级:可以排序
等距:可以解释差多少
等比:可以解释差多少和多少倍

六西格玛项目开始时,可以使用这张判断表

检查问题 需要确认的内容
数据代表什么? 类别、等级、计数还是连续测量
数据怎样产生? 观察、判断、计数、仪器测量或系统计算
零点有什么意义? 只是编码、参考点,还是代表真正没有
数据是否有顺序? 类别之间能否合理排序
差值能否解释? 相差一个单位是否具有一致含义
比例能否解释? 两倍、三倍是否具有业务意义
Y是什么类型? 连续、二项、计数、有序或多分类
X是什么类型? 连续因素或类别因素
数据是否可靠? 操作定义、测量系统和记录过程是否受控
分析目的是什么? 描述、比较、预测、分类或过程控制

常见问题

有数字的数据都是定量数据吗?

不是。供应商编号、员工编号、产品代码和满意度等级虽然可以用数字记录,但数字可能只是类别标签或顺序代码,不能自动视为连续定量数据。

缺陷数量属于什么数据?

缺陷数量属于定量、离散和计数数据。在质量管理中,它通常归入属性数据,并根据检验机会是否固定考虑c图或u图等方法。

合格与不合格属于什么尺度?

合格与不合格属于二分类的名目尺度。编码为0和1以后,仍然是二项结果,通常使用比例、二项分布、卡方或Logistic回归等方法分析。

Likert五点量表属于哪一种数据?

单道Likert题目通常首先视为等级数据。多道题组成的量表总分是否可以近似作为连续数据,需要结合量表设计、样本量、分布和分析目的判断。

计数数据有绝对零点,为什么还被称为属性数据?

「等比尺度」和「属性数据」来自不同分类体系。缺陷数量的零点具有意义,因此具有等比尺度特征;但在质量管理中,它通过计数缺陷产生,所以通常归入属性数据。

连续数据一定比属性数据好吗?

不一定。若问题本身就是类别结果,例如颜色是否正确或产品是否通过安全测试,属性数据最能反映客户要求。连续数据只有在适合问题、测量可靠并且能够保留有用信息时才更有价值。

数据类型的目的不是分类,而是避免错误分析

学习数据类型,不是为了背诵四个英文名称,而是为了理解每组数据允许我们作出什么判断。

名目尺度告诉我们对象属于哪一类,等级尺度增加了高低顺序,等距尺度让差值能够解释,等比尺度则进一步允许比例比较。质量管理还要继续判断数据属于属性还是变量、离散还是连续,因为这些差异会影响控制图、过程能力和假设检验。

在实际六西格玛项目中,比追求所谓「更高级的数据」更重要的是三件事:数据必须反映客户真正重视的CTQ,数据定义必须一致,测量系统必须可靠。

项目开始分析前,应先问清楚X和Y分别是什么数据、数据怎样产生,以及准备回答什么问题。在六西格玛绿带的DMAIC逻辑中理解这些关系,比孤立背诵每一种图表和检验方法更有效。

数据类型判断正确,统计工具才有正确的起点;如果最初分类已经错误,后面再复杂的模型也只是在精确地分析错误的问题。