
在质量管理和六西格玛项目中,我们经常根据测量数据判断一个过程到底好不好。
产品尺寸有没有超差?灌装量是否达到500 ml?过程能力Cpk够不够?控制图出现异常点,是过程真的发生变化,还是数据本身出了问题?
这些分析都有一个共同前提:
我们手上的测量数据必须足够可靠。
如果测量系统本身存在很大的误差,再复杂的统计分析也可能得到错误结论。
这正是MSA(Measurement System Analysis,测量系统分析)存在的意义。
MSA不是单纯检查「量具准不准」,而是系统研究整个测量过程产生的变异,包括测量工具、操作人员、测量方法、环境以及不同产品之间的交互影响。
优思学院在六西格玛课程中讲解MSA时,会先让学员理解一个非常重要的概念:
我们观察到的变异,并不完全等于产品真正的变异。
测量过程本身,也会把额外的变异加入数据之中。
一、MSA测量系统分析到底在分析什么?
假设现在有一瓶真实灌装量为500 ml的产品。
我们拿一个量具进行测量,再由操作人员读取结果。
如果测量系统完全没有误差,每次都应该得到500 ml。
但现实中可能出现:
499 ml、500 ml、501 ml。
产品没有改变,为什么测量结果会改变?
因为一次测量并不是「产品直接变成数据」,而是经历了一个测量过程:
产品(Part) → 测量工具(Gauge) → 观察者(Observer) → 测量结果。

优思学院课程通过这个模型说明,测量工具可能存在微小差异,操作人员的使用方式、观察角度、夹持力度、读数方式也可能带来变化。
因此:
观察值 = 真实值 + 测量误差。
这种测量误差并不一定每次完全相同,因此会形成所谓的测量变异(Measurement Variation)。
MSA真正想回答的问题,就是:
我们看到的数据差异,到底有多少是真的产品差异,又有多少只是测量系统制造出来的差异?
二、为什么做Cpk、SPC之前,要先考虑MSA?
很多质量工程师拿到数据以后,会马上计算Cp、Cpk,或者画控制图。
但这里有一个容易被忽略的问题。
假设某个产品真实的尺寸分布其实很集中,可是量具本身重复测量的波动很大。
测量以后,我们看到的数据分布就会变宽。
这时计算出来的Cpk可能降低。
工程师看到结果后,很容易判断:
「生产过程波动太大,需要改善。」
但真实情况可能是:
生产过程没有那么差,是测量系统让它看起来更差。
同样的问题也会影响SPC。
控制图出现的波动,有一部分来自真正的过程变异,还有一部分可能来自测量系统。
如果测量误差过大,质量人员就可能对正常过程作出错误反应。
因此,在重要的过程能力分析、SPC监控和改善项目中,确认测量系统的可靠性是非常重要的一步。
三、观察到的总变异,不等于产品真实变异
优思学院课程把这个关系进一步用方差模型表达:
σ²TV = σ²PV + σ²MV
其中:
σ²TV:观察到的总变异(Total Variation)
σ²PV:实际产品变异(Part Variation)
σ²MV:测量系统产生的变异(Measurement Variation)

这个关系揭示了MSA中一个非常关键的统计思想:
测量系统本身也是变异来源。
假设产品真实分布原本位于LSL和USL之间。
如果测量系统再加入一层额外变异,最终观察到的分布就会变宽。
于是,一些实际合格的产品可能因为测量误差而落到规格界限之外,被误判成不良品。
反过来也可能发生:
实际已经超出规格的产品,因为测量误差而被误判为合格。
所以测量系统不好,造成的不只是「数据不漂亮」。
它可能直接影响:
- 产品放行;
- 报废和返工;
- 供应商判定;
- 客户验收;
- 过程能力分析;
- SPC控制;
- 六西格玛项目的原因分析。
四、MSA中的Accuracy和Precision有什么区别?
理解MSA时,一个很重要的基础是区分准确性(Accuracy)和精密性(Precision)。
两者经常被混在一起。
优思学院课程使用射箭靶子的方式来解释这个问题。

可以把每一次测量结果想象成射在靶上的一支箭。
箭与箭之间是否集中,代表Precision。
箭群整体是否接近真实中心,则与Accuracy有关。
1. 精密,而且准确
多次测量结果非常集中,同时也接近真实值。
这是最理想的状态。
例如标准件真实值是50.000 mm,多次测量结果可能集中在:
49.999、50.001、50.000、50.001 mm。
数据既集中,也接近真实值。
2. 不精密,但整体位置准确
如果测量结果分布很散,但整体围绕真实值波动,平均位置可能仍然接近真实值。
这种系统的问题不是中心位置,而是重复测量的一致性不足。
3. 精密,但不准确
这是MSA中特别值得注意的一种情况。
多次测量非常集中,但整体偏离真实值。
例如一个50.000 mm的标准件,每次几乎都测到50.080 mm。
测量系统非常稳定。
但它在:
稳定地测错。
这种中心位置与参考值之间的系统性差异,就涉及偏倚(Bias)。
4. 不精密,也不准确
数据既分散,又偏离真实值。
这种测量系统同时存在明显的精密性和准确性问题,自然很难支持可靠的质量判断。
五、MSA主要分析哪几种测量系统特性?
完整的计量型MSA通常不会只看一个指标。
常见的几个核心概念包括:
- 偏倚(Bias);
- 线性(Linearity);
- 稳定性(Stability);
- 重复性(Repeatability);
- 再现性(Reproducibility)。
其中重复性和再现性经常合在一起研究,也就是大家最常听到的:
Gage R&R,简称GRR。
六、什么是偏倚Bias?
偏倚描述的是:
测量结果的平均值与参考值之间存在多大的系统性差异。
假设一个经过可靠标准设备确认的标准件真实参考值为:
50.000 mm
使用生产现场的量具重复测量多次以后,平均结果为:
50.060 mm
那么可以理解为测量系统存在约+0.060 mm的偏倚。
值得注意的是,Bias不是看某一次测量偏高或偏低,而是看重复测量后的平均位置是否系统性偏离参考值。
如果发现明显偏倚,常见检查方向包括:
- 量具是否正确校准;
- 零点是否存在偏移;
- 标准件参考值是否可靠;
- 测量基准是否一致;
- 量具是否磨损;
- 操作方法是否造成固定方向的误差。
七、什么是Linearity线性?
一把量具在某个位置测得准确,不代表它在整个量程内都同样准确。
这就是为什么MSA还要研究线性(Linearity)。
线性关注的是:
Bias是否随着被测量数值的大小而发生系统性变化。
例如一把0~100 mm的量具:
测10 mm时偏差很小;
测30 mm时偏高0.01 mm;
测60 mm时偏高0.03 mm;
测90 mm时偏高0.06 mm。
这时问题已经不只是单纯存在固定Bias。
偏差似乎随着量程增加而越来越大。
这就是需要进一步检查的线性问题。
进行Linearity Study时,通常会选择多个覆盖测量范围的参考件,对每个参考值重复测量,再观察Bias与参考值之间是否存在明显的系统性关系。
如果偏倚随量程明显变化,可能需要检查量具的校准、机械结构、传感器特性或不同量程范围的性能。
八、什么是Stability稳定性?
一个测量系统今天表现很好,不代表三个月以后还一样。
MSA中的稳定性关注的是:
测量系统的表现是否会随着时间发生变化。
例如使用同一个标准件,今天测量是50.000 mm,一个月后平均变成50.020 mm,再过一个月变成50.040 mm。
如果这种变化具有持续趋势,就可能说明测量系统正在发生漂移。
可能原因包括:
- 量具磨损;
- 传感器老化;
- 环境温度变化;
- 校准状态改变;
- 测量设备零点漂移;
- 长期使用造成机械变化。
稳定性研究通常需要在一段时间内持续测量同一个参考件,再通过控制图等方法观察系统随时间是否保持稳定。
九、什么是Repeatability重复性?
重复性研究的是:
同一个操作人员,使用同一个量具,对同一个产品重复测量时产生的变异。
例如:
同一名检验员使用同一把千分尺,对同一个零件连续测量三次:
20.01 mm
20.04 mm
19.99 mm
这些测量之间的差异,就包含重复性变异。
在Gage R&R分析中,Repeatability也经常称为:
Equipment Variation,EV。
不过EV高并不一定可以简单理解成「一定是量具坏了」。
实际原因还可能涉及:
- 量具分辨率不足;
- 夹紧力度变化;
- 测量位置不同;
- 产品固定方式不同;
- 测量方法本身不稳定;
- 环境条件变化。
所以发现重复性问题以后,需要结合现场测量过程进一步分析。
十、什么是Reproducibility再现性?
再现性关注的是:
不同评价者或操作人员使用同一测量系统时,测量结果是否存在系统性差异。
例如:
操作员A平均测量结果为50.01 mm;
操作员B平均为50.06 mm;
操作员C平均为49.98 mm。
如果不同人员之间长期存在明显差异,就说明测量结果可能受到评价者影响。
在传统Gage R&R分析中,这部分通常称为:
Appraiser Variation,AV。
造成再现性问题的常见原因包括:
- 不同操作员使用不同测量手法;
- 测量基准理解不一致;
- 夹持力度不同;
- 读数方式不同;
- SOP描述不够清楚;
- 操作培训不足。
十一、GRR是什么?
GRR是Gage Repeatability and Reproducibility的简称。
它把重复性和再现性结合起来,用来评估测量系统产生的变异相对于整体变异到底有多大。
可以简单理解成:
GRR越大,代表测量系统加入的数据噪声越多。
如果两个产品的真实差异很小,而测量系统自己的波动却很大,测量设备就可能无法可靠区分这两个产品。
这也是为什么GRR不是单纯讨论「量具精度是多少」。
它关心的是整个测量系统在真实使用环境下,能否可靠识别产品之间真正存在的差异。
十二、一个标准的Gage R&R研究怎么做?
经典的Crossed Gage R&R研究通常会安排:
- 选择一组能够代表实际过程变异范围的零件;
- 安排多名实际参与测量的评价者;
- 每位评价者对每个零件进行多次重复测量;
- 尽量随机化测量顺序;
- 避免评价者知道前一次测量结果。
常见设计是:
10个零件 × 3名评价者 × 每人重复测量2~3次。
这里很容易出现一个错误:
为了做GRR,专门挑10个几乎完全一样的零件。
这样虽然看起来比较「公平」,但可能导致研究中的Part-to-Part Variation过小,反而影响测量系统区分能力的判断。
做MSA研究时,样品应该尽可能代表实际生产过程中真实可能出现的变异范围。
十三、GRR报告中的%Contribution是什么意思?
在Minitab等统计软件的Gage R&R输出中,经常会同时出现几个百分比。
它们不能混在一起理解。
%Contribution反映的是各变异来源的方差分量占总方差的比例。
例如总变异中:
多少来自Part-to-Part;
多少来自Repeatability;
多少来自Reproducibility。
它特别适合帮助分析:
主要的变异来源到底在哪里。
十四、%Study Variation是什么意思?
%Study Variation是实际工作中非常常见的GRR评价指标。
它比较的是测量系统变异相对于研究中总变异的大小。
也就是说,它在回答:
我们观察到的整体波动中,测量系统本身的波动到底占了多大的相对范围?
常见的经验性评价框架是:
- GRR低于10%:测量系统通常表现较好;
- 10%~30%:需要结合测量用途、产品风险、改善成本等判断是否可以接受;
- 高于30%:通常表示测量系统需要进一步改善。
不过这里特别需要注意:
10%和30%不是脱离情境就可以机械使用的「合格/不合格红线」。
一个用于安全关键特性的测量系统,和一个用于低风险过程监控的测量系统,对测量能力的要求可能不同。
十五、%Tolerance又是什么?
%Tolerance关注的是:
测量系统的变异相对于产品规格公差到底有多大。
这和%Study Variation的视角不同。
%Study Variation关注当前研究中的过程变异。
%Tolerance则把测量系统与规格宽度联系起来。
因此,不建议只看到一个GRR百分比就立即下结论。
需要先确认:
这个百分比到底是%Contribution、%Study Variation还是%Tolerance。
三者回答的不是完全相同的问题。
十六、NDC是什么?为什么GRR之外还要看NDC?
NDC是Number of Distinct Categories的简称,中文常译为可区分类别数。
它反映的是:
测量系统能够把实际产品差异分辨成多少个不同层级。
如果NDC很低,代表测量系统虽然可以给出数字,但区分不同产品状态的能力有限。
例如一个测量系统面对实际不同的产品,却只能模糊地区分成「比较高」和「比较低」两类,那么它对过程改善和SPC的帮助就会受到限制。
在实际MSA分析中,经常把:
NDC达到5或以上
作为一个重要参考。
NDC越高,通常说明测量系统相对于实际产品变异具有更好的分辨能力。
十七、为什么GRR看起来不错,NDC却可能低于5?
这是做MSA时非常常见的问题。
出现这种情况,不一定代表量具突然出了问题。
一个重要原因可能是:
你拿来做GRR研究的零件彼此太相似。
NDC与产品之间的实际变异有关。
如果研究中的10个样品全部集中在非常窄的范围内,那么Part-to-Part Variation很小,测量系统自然比较难把它们分成多个明显类别。
因此看到NDC很低时,可以检查:
- 样品是否覆盖真实过程范围;
- 是否为了做MSA刻意选了太相似的零件;
- 量具分辨率是否足够;
- 测量系统变异是否真的过大。
这也说明:
好的MSA研究设计,比单纯按软件按钮更加重要。
十八、Crossed Gage R&R和Nested Gage R&R有什么区别?
大多数常规尺寸测量会使用Crossed Gage R&R。
它的特点是:
同一个零件可以由不同评价者重复测量。
例如一个金属零件可以交给操作员A、B、C分别测量,每个人都可以反复测同一个零件。
但有些测试是破坏性的。
例如:
- 拉伸测试;
- 破坏强度测试;
- 某些化学检验;
- 需要消耗样品的实验。
一个样品测试完成以后就不能重新交给其他操作人员测量。
这种情况下,Crossed设计可能无法成立。
就需要考虑Nested Gage R&R等更符合实际测试结构的方法。
所以选择哪一种GRR方法,不应该只看软件菜单,而要先理解:
同一个样品能不能由不同评价者重复测量。
十九、计量型MSA和计数型MSA有什么区别?
前面讨论的大部分内容,都属于计量型测量系统。
例如:
长度、重量、压力、温度、硬度、时间。
这些测量结果是连续数值,可以进行GRR、Bias、Linearity和Stability等分析。
但现实中还有另一类测量系统:
计数型或属性型判断。
例如:
OK / NG;
合格 / 不合格;
划伤 / 无划伤;
等级A / B / C。
这种情况下,不能直接套用计量型Gage R&R的方法。
我们更关注的是:
不同评价者之间是否判断一致?
同一个评价者重复判断是否一致?
他们与标准答案之间是否一致?
这属于Attribute Agreement Analysis等属性型测量系统分析的范畴。
二十、Minitab做Gage R&R时要看什么?
使用Minitab进行Gage R&R分析时,不应该只找到一个「%GRR」数字就结束。
一份有意义的分析通常需要结合多个结果。
常见需要查看的内容包括:
- Total Gage R&R;
- Repeatability;
- Reproducibility;
- Part-to-Part Variation;
- %Contribution;
- %Study Variation;
- %Tolerance;
- NDC;
- 不同零件的测量分布;
- 不同评价者之间的差异;
- 相关图表是否显示异常模式。
真正重要的不是:
「GRR到底是8.6%还是11.2%?」
而是进一步问:
测量系统的主要问题来自哪里?它是否足以影响我们的质量判断?
二十一、GRR不理想时应该怎么改善?
GRR不理想时,不建议第一反应就是:
「买一台更贵的量具。」
更合理的做法,是先判断变异来源。
如果重复性问题比较明显
可以检查:
- 量具的分辨率是否适合当前公差;
- 量具是否磨损;
- 产品定位方式是否稳定;
- 测量位置是否统一;
- 夹持力度是否一致;
- 环境条件是否影响结果。
如果再现性问题比较明显
可以检查:
- 不同人员是否采用同样的测量方法;
- SOP是否明确;
- 测量基准是否统一;
- 员工是否经过一致的培训;
- 是否存在主观读数问题。
如果Bias明显
应进一步检查:
- 校准状态;
- 参考标准;
- 零点;
- 固定方向的操作偏差;
- 量具系统性误差。
如果Linearity存在问题
需要检查测量系统是否在不同量程范围内具有不同程度的Bias。
如果Stability存在问题
则应该把重点放在:
时间、磨损、环境、设备漂移和校准周期。
二十二、MSA最容易犯的几个错误
第一个错误,是认为校准合格就等于MSA合格。
校准非常重要,但校准和MSA并不是同一件事。
一台设备即使校准状态正常,在真实现场使用时仍可能因为人员、方法和环境产生很大的测量变异。
第二个错误,是只看GRR,不看NDC。
一个测量系统真正有没有能力区分不同产品,还需要结合Part-to-Part Variation和NDC理解。
第三个错误,是只看一个百分比。
%Contribution、%Study Variation和%Tolerance的含义并不相同。
第四个错误,是GRR样品选得太集中。
样品没有代表实际过程范围,会让研究结果失去一部分实际意义。
第五个错误,是把所有问题都归咎于量具。
MSA分析的是测量系统,而测量系统包括的不只是仪器。
人员、方法、产品定位和环境同样可能是主要变异来源。
二十三、MSA与六西格玛DMAIC有什么关系?
MSA通常是六西格玛DMAIC中Measure阶段的重要工具。
Measure阶段的任务并不只是「收集数据」。
更重要的是确认:
这些数据能不能真实地描述我们正在研究的问题。
如果测量系统不可靠,Analyze阶段使用假设检验、ANOVA、回归分析等方法时,结论也可能受到影响。
到了Improve阶段,即使真的找到改善方案,如果测量系统噪声过大,也可能无法可靠判断改善前后究竟有没有真正变化。
所以MSA实际上贯穿了整个数据分析逻辑。
优思学院在六西格玛课程中把测量变异放在MSA学习的重要位置,就是希望学员在使用统计工具之前先建立这个意识:
数据不是现实本身,数据只是我们通过测量系统观察现实以后得到的结果。
二十四、MSA到底想解决什么问题?
把Bias、Linearity、Stability、Repeatability、Reproducibility、GRR和NDC全部学完以后,MSA最终还是回到一个很简单的问题:
我能不能相信这个测量结果?
当两个产品测出来不同,我们希望确认它们是真的不同。
当控制图出现异常,我们希望确认异常真的来自过程。
当Cpk下降,我们希望确认过程真的变差。
当一个产品被判定超出规格,我们也希望确认它是真的超规格,而不是测量系统把它推到了规格线之外。
所以MSA不是单纯的量具管理。
它真正保护的是:
质量决策的可靠性。
二十五、MSA常见问题FAQ
GRR多少算合格?
常见参考是GRR低于10%通常代表测量系统表现较好;10%~30%需要结合测量用途、风险和成本进一步判断;高于30%通常需要考虑改善。但在实际应用中,不应脱离测量特性的重要程度机械使用百分比。
GRR合格,NDC低于5怎么办?
可以先检查研究样品是否覆盖真实的过程变异。如果样品彼此太相似,Part-to-Part Variation过小,就可能造成NDC偏低。同时也需要检查量具分辨率和测量系统本身的变异。
Bias和Linearity有什么区别?
Bias关注测量平均值与参考值之间的差异;Linearity则进一步研究Bias是否会随着测量范围改变。
重复性和再现性有什么区别?
重复性主要研究同一评价者、同一量具重复测量时产生的变异;再现性主要研究不同评价者之间是否存在测量差异。
校准通过以后还要不要做MSA?
可能仍然需要。校准主要确认设备与标准之间的关系,而MSA关注的是量具在实际使用环境中,由人员、方法、产品和设备共同形成的整个测量系统是否可靠。
为什么做Cpk之前最好确认测量系统?
因为观察到的数据变异包含产品变异和测量变异。如果测量系统本身加入太多波动,计算出来的过程能力可能无法准确反映真实过程表现。
破坏性测试可以做GRR吗?
可以研究测量系统,但研究设计与一般Crossed Gage R&R不同。如果同一个样品无法被多名评价者重复测量,就需要根据测试结构考虑Nested等研究方法。
结语:先确认尺子,再讨论产品
MSA最值得记住的并不是某一个公式。
而是一种质量管理思维:
在相信数据之前,先确认产生数据的系统是否值得相信。
产品存在变异,测量本身也存在变异。
我们最终看到的数字,是两者共同作用的结果。
只有把产品真正的变异与测量系统造成的变异尽可能区分开来,Cpk、SPC、DOE以及后续六西格玛分析才建立在更可靠的基础上。
这也是MSA在六西格玛Measure阶段如此重要的原因。





