
六西格玛项目进入数据分析阶段后,很多人会急着选择控制图、假设检验或回归模型,却忽略了一个更基础的问题:手上的数据究竟属于什么类型?
同样是数字,「产品直径10.02毫米」「缺陷数量4个」和「满意度等级4分」代表的含义完全不同。直径可以测量到更细的小数,缺陷数量只能逐个计算,满意度中的4则主要代表一个有顺序的等级。三者虽然都用数字记录,允许进行的数学运算和统计分析却并不相同。
数据类型判断错误,后面的分析工具也容易选错。例如,把供应商编号当作连续数值计算平均值,把通过与不通过的数据放进普通ANOVA,或者对每件产品的缺陷数量使用不合适的控制图,都可能得出没有意义的结果。
要把数据类型真正弄清楚,不能只背诵Nominal、Ordinal、Interval和Ratio四个名称。更实用的做法,是从三个不同角度观察数据:
- 数据表达的是类别,还是数量;
- 数据处于哪一种测量尺度;
- 数据在质量管理中属于属性、计数还是连续测量。
这些分类之间会有交叉,但回答的问题不同。只有把它们分开理解,才能正确选择图表、描述统计、控制图和假设检验。
数据分类为什么看起来总是互相矛盾?
学习统计时,我们会看到定性与定量、属性与变量、离散与连续,以及四种测量尺度等多套分类。有人会因此产生疑问:一个数据到底只能属于一种类别,还是可以同时拥有多个名称?
答案是:同一组数据可以从不同角度分类。
例如「每件产品的缺陷数量」:
- 它用数字表示数量,因此属于定量数据;
- 它通过计数得到,因此属于离散数据;
- 在质量管理中,它通常归入属性数据;
- 零个缺陷代表没有缺陷,比例也可以解释,因此通常具有等比尺度特征。
这些说法并不冲突,只是分类角度不同。
再看「客户满意度:非常不满意、不满意、一般、满意、非常满意」:
- 它表达类别和等级,因此通常归入定性数据;
- 类别有明确顺序,所以属于等级尺度;
- 即使编码成1至5,也不会自动变成连续变量;
- 在某些统计模型中,可以根据量表设计把多题总分近似当作连续数据处理,但需要说明分析假设。
所以,判断数据类型不是为数据贴上唯一标签,而是确认它携带哪些信息,以及准备怎样使用。
第一种分类:定性数据和定量数据
从最基本的表现形式来看,数据可以分为定性数据和定量数据。
定性数据:说明对象属于哪一类
定性数据(Qualitative Data)也常称为类别数据,主要描述对象的属性、状态、类型或等级。
例如工厂分析客户投诉时,可能记录:
- 投诉类型:外观、尺寸、功能、包装;
- 责任环节:设计、采购、生产、运输;
- 供应商:A、B、C;
- 产品状态:合格、不合格;
- 严重程度:轻微、一般、严重。
这些数据主要回答「是什么」或「属于哪一类」,不直接表示一个可以进行普通加减乘除的数量。
定量数据:说明有多少或相差多少
定量数据(Quantitative Data)使用数值表示数量、大小、时间、距离、强度或其他可以计算的结果。
例如:
- 轴径:10.024毫米;
- 产品重量:502.6克;
- 生产周期:42.8秒;
- 拉伸强度:580 MPa;
- 客户等待时间:18.5分钟;
- 每批不良品数量:12件。
不过,定量数据不一定都是连续测量值。每批有12件不良品同样是数字,却属于计数结果。要决定采用什么分析方法,还要继续判断它是离散数据还是连续数据。
第二种分类:四种测量尺度
测量尺度(Scale of Measurement)关注的不是数据长得像文字还是数字,而是数据包含多少数学信息。经典分类包括:
- 名目尺度(Nominal);
- 等级尺度(Ordinal);
- 等距尺度(Interval);
- 等比尺度(Ratio)。
| 测量尺度 | 能够分类 | 能够排序 | 差值可解释 | 比例可解释 | 常见示例 |
|---|---|---|---|---|---|
| 名目尺度 | 是 | 否 | 否 | 否 | 供应商、颜色、缺陷类型 |
| 等级尺度 | 是 | 是 | 通常不能准确解释 | 否 | 满意度、风险等级、严重程度 |
| 等距尺度 | 是 | 是 | 是 | 否 | 摄氏温度、日历年份 |
| 等比尺度 | 是 | 是 | 是 | 是 | 重量、长度、时间、数量 |
四种尺度从上至下通常包含越来越多的信息,但这不代表下面的尺度必然比上面的尺度更重要。一个名目型客户要求同样可能决定产品能否被接受。
名目尺度:数字也可能只是一张标签
名目尺度(Nominal Scale)只负责区分类别,类别之间没有天然的顺序关系。
常见例子包括:
- 产品颜色:黑、白、红;
- 供应商:A、B、C;
- 缺陷类型:划伤、破损、污染;
- 班次:早班、中班、夜班;
- 产品结果:合格、不合格。
为了方便输入软件,企业经常把类别编码成数字。例如:
这里的0和1只是代码。1不代表比0多一个单位,也不能据此说不合格是合格的某种倍数。
同样地,若把三个供应商编码为:
计算「平均供应商编号」通常没有业务意义。编号3也不代表供应商C的表现是供应商A的三倍。
名目数据常用的分析包括:
- 频数和百分比;
- 众数;
- 条形图和柏拉图;
- 列联表;
- 卡方检验;
- 二项或多项分类模型。
对于二分类结果,还可以分析不良率、通过率或发生概率。不过,即使编码为0和1,也要记住其本质仍然是类别结果。
等级尺度:知道高低,却不知道相差多远
等级尺度(Ordinal Scale)比名目尺度多了一项信息:类别之间具有明确顺序。
例如:
- 风险等级:低、中、高;
- 缺陷严重度:轻微、主要、严重;
- 教育程度:中学、大学、硕士、博士;
- 客户评价:非常不满意、不满意、一般、满意、非常满意。
这些类别可以排序,但相邻等级之间的距离未必相等。
假设客户满意度编码为:
我们知道5代表的满意程度高于4,4又高于3。但不能直接证明「非常不满意」到「不满意」的心理差距,与「满意」到「非常满意」完全相等。
这也是为什么单题Likert量表通常首先被视为等级数据。给类别编上1至5,只是方便排序和计算,不会自动让它具有真正的等距或等比性质。
等级数据常用的分析包括:
- 频数和累积百分比;
- 中位数和百分位数;
- 秩和相关分析;
- Mann-Whitney、Kruskal-Wallis等非参数检验;
- 有序Logistic回归。
在实际研究中,多道设计良好的Likert题目可能被组合成一个量表总分,并在满足一定条件时近似作为连续变量分析。但这种做法需要结合量表设计、样本量、分布和模型稳健性判断,不能只因为数据是1至5便直接套用所有连续数据方法。
等距尺度:差多少有意义,多少倍却没有意义
等距尺度(Interval Scale)具有顺序,并且相邻数值之间的距离可以一致解释。
摄氏温度是最常见的例子:
- 10℃到20℃相差10℃;
- 20℃到30℃也相差10℃。
两个10℃的差距具有相同含义,因此可以计算和比较温差。
但是,0℃并不代表完全没有温度。摄氏温标的零点是人为设定的参考点,所以不能说20℃是10℃的「两倍热」。
日历年份也具有类似性质。2000年至2010年相隔10年,2010年至2020年也相隔10年,但不能说2020年是1010年的两倍。
等距数据可以进行许多常见统计运算,包括平均值、标准差、相关和回归。不过,涉及「几倍」的比例解释通常不成立。
等比尺度:零点、差值和比例都有实际意义
等比尺度(Ratio Scale)具备分类、排序、相等间距和有意义的绝对零点,因此允许解释差值和比例。
常见例子包括:
- 长度和直径;
- 重量;
- 加工时间;
- 运输距离;
- 产量和销售数量;
- 缺陷数量;
- 绝对温标中的温度。
假设两个产品分别重100克和200克,我们既可以说第二个产品多100克,也可以说它是第一个产品的两倍重。
这种比例能够解释,是因为0克确实代表没有这部分重量。
等比尺度通常允许使用最完整的算术和统计分析,但是否选择某种方法,还要检查数据分布、样本独立性、测量系统、模型假设和研究目的。
测量尺度不是统计方法的唯一决定因素
四种测量尺度有助于理解数据能够表达什么,但不能单凭尺度名称机械地选择统计工具。
例如,直径和交付时间都属于等比尺度,但直径可能近似对称分布,交付时间却经常明显右偏。两者即使尺度相同,也未必适合使用完全相同的模型。
选择方法时还要考虑:
- 数据是结果Y还是解释因素X;
- 数据是独立样本还是配对、重复测量;
- 数据分布是否符合模型要求;
- 样本量是否足够;
- 是否存在删失、零值过多或异常值;
- 研究目标是比较、预测、分类还是过程监控。
因此,「测量尺度决定统计方法」是一种入门层面的简化说法。更准确的表达是:测量尺度决定哪些运算和解释具有意义,并限制可以合理使用的分析方法。
第三种分类:属性数据与变量数据
在六西格玛、质量管理和SPC中,数据还经常被分成属性数据(Attribute Data)和变量数据(Variable Data)。
属性数据包括分类结果和计数结果
属性数据常见形式包括:
- 合格或不合格;
- 有缺陷或无缺陷;
- 缺陷类型;
- 每件产品发现多少个缺陷;
- 一批产品中有多少件不良品。
属性数据内部还要区分两种概念:
- 不良品(Defective Unit):一件产品是否属于不合格;
- 缺陷(Defect):一件产品上出现多少项不符合。
一件产品可以只有一个不良品结果,却可能同时存在多个缺陷。例如一辆汽车被判定为不合格,是一个不良品;车身划伤、车灯失效和座椅破损,则是三个缺陷。
这一区别会直接影响属性控制图的选择。
变量数据通常通过测量得到
变量数据是使用测量仪器或记录系统获得的数值,例如:
- 轴径10.018毫米;
- 重量501.6克;
- 反应时间38.4秒;
- 拉伸强度582 MPa;
- 室内温度24.6℃。
变量数据通常能保留较多过程信息。例如,两件产品都判定为合格,但一件尺寸位于目标附近,另一件已经接近规格上限。合格与不合格只保留最终分类,实际尺寸则保留了偏离目标的程度。
离散数据与连续数据又有什么区别?
定量数据可以进一步分为离散数据和连续数据。
离散数据通常是数出来的
离散数据(Discrete Data)只能取某些分开的数值,最常见的是整数计数。
例如:
- 今天收到12宗客户投诉;
- 一批产品发现8件不良品;
- 一件产品上存在3处缺陷;
- 一小时生产48件产品。
在这些情况下,不会出现3.7宗投诉或2.4处缺陷。数据虽然是数字,却不是连续测量值。
连续数据通常是量出来的
连续数据(Continuous Data)理论上可以在某个范围内取任意数值,精度主要受到测量仪器限制。
例如:
- 直径20.016毫米;
- 重量12.382千克;
- 加工时间35.728秒;
- 温度82.56℃。
如果使用分辨率更高的仪器,还可以继续记录更多小数。
所以,看到数字时不能立即认定它是连续数据。数量4是离散计数,尺寸4.00毫米则可能是连续测量结果。关键在于数据是怎样产生的。
属性、变量、离散和连续之间怎样对应?
| 数据示例 | 主要形式 | 离散或连续 | 质量管理分类 |
|---|---|---|---|
| 合格/不合格 | 类别 | 离散 | 属性数据 |
| 缺陷类型 | 类别 | 离散 | 属性数据 |
| 不良品数量 | 计数 | 离散 | 属性数据 |
| 每件产品缺陷数 | 计数 | 离散 | 属性数据 |
| 产品直径 | 测量值 | 连续 | 变量数据 |
| 加工时间 | 测量值 | 连续 | 变量数据 |
在传统质量管理术语中,计数数据经常被归入属性数据,尽管它同时也是定量和离散数据。这正说明不同分类体系关注的角度并不相同。
为什么六西格玛倾向保留连续数据?
如果同一个过程结果既可以记录为连续测量值,也可以压缩成合格与不合格,连续数据通常能够保留更多信息。
例如一家企业要求订单在48小时内交付。企业可以采用两种记录方法。
第一种方法只记录:
这种数据可以计算准时率和迟交率,却看不到订单究竟提前或延迟了多少。
第二种方法记录每张订单的实际交付时间,例如:
这组数据除了能够判断是否超过48小时,还可以研究:
- 平均和中位交付时间;
- 过程变异和分布形态;
- 订单之间的差异;
- 哪些订单类型更容易延误;
- 改善前后的时间变化;
- 过程满足48小时要求的能力。
如果企业一开始便把交付时间压缩成准时和迟交,许多过程信息会永久消失。
不过,连续数据只有在测量可靠时才有优势。若时间起点和终点定义不一致,或者不同部门采用不同记录规则,数据精细到小数点后两位也没有实际价值。
名目数据不低级,它可能直接决定客户是否接受
把四种尺度排列以后,人们容易误以为等比尺度最高级,名目尺度最低级。实际上,信息量较少不等于业务重要性较低。
假设客户订购一辆黑色汽车。工厂生产出来的车辆在长度、重量、动力、油耗和安全测试方面全部符合要求,却把车身做成白色。
「黑色」和「白色」属于名目数据,没有大小顺序,也不能计算平均值。但是颜色是订单中的关键要求,做错以后客户完全可能拒收。
因此,数据价值不取决于能够进行多少数学运算,而取决于它是否正确反映客户重视的CTQ关键质量特性。
六西格玛项目不应为了使用复杂统计方法,强行把所有需求转化为连续数据。客户要求是什么,就应该采用能够真实描述该要求的数据。
数据类型如何影响SPC控制图的选择?
在SPC中,变量数据与属性数据使用不同的控制图。即使都属于属性数据,也要区分记录的是不良品还是缺陷,以及每次检查的机会是否相同。
| 数据和取样情况 | 常用控制图 |
|---|---|
| 连续数据,每组有多个观测值,子组较小 | X̄-R图 |
| 连续数据,每组有多个观测值,子组较大 | X̄-S图 |
| 连续数据,每次只有一个观测值 | I-MR图 |
| 不良品比例,样本量可变化 | p图 |
| 不良品数量,样本量固定 | np图 |
| 缺陷数量,检验机会固定 | c图 |
| 单位缺陷数,检验机会可变化 | u图 |
例如每天检查100件产品并记录不良品数量,可以考虑np图;如果每天抽样数量不同,则通常使用p图。若记录的是每件产品表面发现多少处缺陷,而不是有多少件不良品,则需要考虑c图或u图。
控制图选择错误,不只是图表名称不准确,还会导致控制限计算和异常判断出现问题。
数据类型怎样影响假设检验?
假设检验的选择会受到结果变量Y、解释变量X、样本结构和分布条件共同影响。
例如企业想比较三家供应商的表现。
结果Y是连续尺寸
如果Y是产品直径,X是供应商A、B、C,团队可能比较三家供应商的平均直径或整体分布。若数据结构和模型条件合适,可以考虑单因子ANOVA;如果相关条件不适合,也可能使用非参数方法或其他模型。
结果Y是合格或不合格
如果Y变成二分类结果,团队关注的便是三家供应商的不良率是否不同。这时可能使用列联表、卡方检验、Fisher精确检验或二项Logistic回归,而不是原封不动地使用连续数据ANOVA。
结果Y是缺陷数量
如果Y是每批发现的缺陷数量,分析就需要考虑计数数据的特性,以及每批产品数量或缺陷机会是否相同。某些情况下可采用Poisson或负二项模型。
结果Y是有序等级
如果Y是供应商评价的低、中、高等级,则可能采用秩检验或有序分类模型。
所以开始分析以前,团队应该先确认:
- Y是什么类型的数据;
- X是什么类型的数据;
- 样本之间是否独立;
- 研究目标是比较差异还是建立预测关系。
这一步做清楚以后,统计方法的选择范围通常会明显缩小。
数字编码不会改变数据的本质
数据分析中一个常见错误,是认为只要把类别转换成数字,就可以按照连续数据处理。
例如把三个地区编码为:
这些数字只是方便软件识别,不能计算平均地区,也不能把地区3解释为地区1的三倍。
类似地,设备编号101、102和103虽然由数字组成,本质上仍然是名目数据。员工编号、订单编号、邮政编码和产品代码也属于同样情况。
判断数据类型时,应看数字代表的业务含义,而不是看单元格里是否出现阿拉伯数字。
百分比也不一定属于同一种分析情境
百分比看起来都是连续数值,但来源可能完全不同。
例如:
- 一批100件产品中有5件不良,不良率为5%;
- 设备当月可动率为95%;
- 员工问卷平均满意比例为80%;
- 材料中某成分占比为5%。
这些数据虽然都以百分比表示,但生成机制、分母和统计性质不同。第一项来自二项计数,第二项与时间构成有关,第三项可能来自问卷汇总,第四项则是连续成分比例。
不能只看到百分号,便认定它们适用相同的控制图或假设检验。
不要为了获得更多数据,把连续变量重复二分
企业经常把原本的连续测量结果转成通过与不通过,以便计算合格率。这种转换对产品放行有实际意义,但如果分析阶段只保留分类结果,会损失大量信息。
例如轴径规格为10.00±0.05毫米,9.951毫米和10.049毫米都被判定为合格。二分类结果看不到它们分别接近不同规格边界,也无法观察过程中心是否正在漂移。
较好的数据管理方式,是保留原始测量值,同时根据需要增加规格判定字段:
| 轴径 | 规格判定 |
|---|---|
| 9.951毫米 | 合格 |
| 10.002毫米 | 合格 |
| 10.049毫米 | 合格 |
| 10.056毫米 | 不合格 |
这样既能满足放行管理,也能保留过程分析所需的信息。
数据精度越高,不代表数据质量越好
六西格玛重视数据,但精确的小数位数不等于可靠的测量结果。
一把分辨率不足的量具,即使系统显示六位小数,也不代表结果真的具备六位小数的精度。不同操作员如果采用不同测量位置,数据看起来详细,实际变异却可能来自测量方法。
在收集连续数据前,应考虑:
- 测量系统的分辨率是否足够;
- 操作定义是否清楚;
- 重复性和再现性是否可以接受;
- 测量过程是否稳定;
- 数据记录和转换是否可能出错。
如果测量系统不可靠,把类别数据换成更细的连续数值不会自动改善分析,反而可能产生虚假的精确感。
四种测量尺度怎样快速判断?
面对一项新数据时,可以依次提出四个问题。
问题一:数据只是用来区分类别吗?
如果数据只能说明对象属于哪一类,而且类别没有天然顺序,通常属于名目尺度。
例如:红色、黄色、蓝色。
问题二:类别之间有明确顺序吗?
如果可以排序,但相邻等级之间的距离不能准确解释,通常属于等级尺度。
例如:差、一般、良好、优秀。
问题三:数值之间的差距是否具有一致含义?
如果增加一个单位在不同位置代表相同差距,数据可能属于等距或等比尺度。
例如摄氏温度中的10℃差距。
问题四:零点是否代表真正的「没有」?
如果零点具有实际意义,而且两倍、三倍等比例能够解释,通常属于等比尺度。若差值有意义,但零点只是人为参考点,则通常属于等距尺度。
等级:可以排序
等距:可以解释差多少
等比:可以解释差多少和多少倍
六西格玛项目开始时,可以使用这张判断表
| 检查问题 | 需要确认的内容 |
|---|---|
| 数据代表什么? | 类别、等级、计数还是连续测量 |
| 数据怎样产生? | 观察、判断、计数、仪器测量或系统计算 |
| 零点有什么意义? | 只是编码、参考点,还是代表真正没有 |
| 数据是否有顺序? | 类别之间能否合理排序 |
| 差值能否解释? | 相差一个单位是否具有一致含义 |
| 比例能否解释? | 两倍、三倍是否具有业务意义 |
| Y是什么类型? | 连续、二项、计数、有序或多分类 |
| X是什么类型? | 连续因素或类别因素 |
| 数据是否可靠? | 操作定义、测量系统和记录过程是否受控 |
| 分析目的是什么? | 描述、比较、预测、分类或过程控制 |
常见问题
有数字的数据都是定量数据吗?
不是。供应商编号、员工编号、产品代码和满意度等级虽然可以用数字记录,但数字可能只是类别标签或顺序代码,不能自动视为连续定量数据。
缺陷数量属于什么数据?
缺陷数量属于定量、离散和计数数据。在质量管理中,它通常归入属性数据,并根据检验机会是否固定考虑c图或u图等方法。
合格与不合格属于什么尺度?
合格与不合格属于二分类的名目尺度。编码为0和1以后,仍然是二项结果,通常使用比例、二项分布、卡方或Logistic回归等方法分析。
Likert五点量表属于哪一种数据?
单道Likert题目通常首先视为等级数据。多道题组成的量表总分是否可以近似作为连续数据,需要结合量表设计、样本量、分布和分析目的判断。
计数数据有绝对零点,为什么还被称为属性数据?
「等比尺度」和「属性数据」来自不同分类体系。缺陷数量的零点具有意义,因此具有等比尺度特征;但在质量管理中,它通过计数缺陷产生,所以通常归入属性数据。
连续数据一定比属性数据好吗?
不一定。若问题本身就是类别结果,例如颜色是否正确或产品是否通过安全测试,属性数据最能反映客户要求。连续数据只有在适合问题、测量可靠并且能够保留有用信息时才更有价值。
数据类型的目的不是分类,而是避免错误分析
学习数据类型,不是为了背诵四个英文名称,而是为了理解每组数据允许我们作出什么判断。
名目尺度告诉我们对象属于哪一类,等级尺度增加了高低顺序,等距尺度让差值能够解释,等比尺度则进一步允许比例比较。质量管理还要继续判断数据属于属性还是变量、离散还是连续,因为这些差异会影响控制图、过程能力和假设检验。
在实际六西格玛项目中,比追求所谓「更高级的数据」更重要的是三件事:数据必须反映客户真正重视的CTQ,数据定义必须一致,测量系统必须可靠。
项目开始分析前,应先问清楚X和Y分别是什么数据、数据怎样产生,以及准备回答什么问题。在六西格玛绿带的DMAIC逻辑中理解这些关系,比孤立背诵每一种图表和检验方法更有效。
数据类型判断正确,统计工具才有正确的起点;如果最初分类已经错误,后面再复杂的模型也只是在精确地分析错误的问题。





