MSA测量系统分析是什么?从GRR、偏倚、线性、稳定性到NDC完整解析

在质量管理和六西格玛项目中,我们经常根据测量数据判断一个过程到底好不好。

产品尺寸有没有超差?灌装量是否达到500 ml?过程能力Cpk够不够?控制图出现异常点,是过程真的发生变化,还是数据本身出了问题?

这些分析都有一个共同前提:

我们手上的测量数据必须足够可靠。

如果测量系统本身存在很大的误差,再复杂的统计分析也可能得到错误结论。

这正是MSA(Measurement System Analysis,测量系统分析)存在的意义。

MSA不是单纯检查「量具准不准」,而是系统研究整个测量过程产生的变异,包括测量工具、操作人员、测量方法、环境以及不同产品之间的交互影响。

优思学院在六西格玛课程中讲解MSA时,会先让学员理解一个非常重要的概念:

我们观察到的变异,并不完全等于产品真正的变异。

测量过程本身,也会把额外的变异加入数据之中。

一、MSA测量系统分析到底在分析什么?

假设现在有一瓶真实灌装量为500 ml的产品。

我们拿一个量具进行测量,再由操作人员读取结果。

如果测量系统完全没有误差,每次都应该得到500 ml。

但现实中可能出现:

499 ml、500 ml、501 ml。

产品没有改变,为什么测量结果会改变?

因为一次测量并不是「产品直接变成数据」,而是经历了一个测量过程:

产品(Part) → 测量工具(Gauge) → 观察者(Observer) → 测量结果。

产品变异 + 测量变异 = 总变异

优思学院课程通过这个模型说明,测量工具可能存在微小差异,操作人员的使用方式、观察角度、夹持力度、读数方式也可能带来变化。

因此:

观察值 = 真实值 + 测量误差。

这种测量误差并不一定每次完全相同,因此会形成所谓的测量变异(Measurement Variation)

MSA真正想回答的问题,就是:

我们看到的数据差异,到底有多少是真的产品差异,又有多少只是测量系统制造出来的差异?

二、为什么做Cpk、SPC之前,要先考虑MSA?

很多质量工程师拿到数据以后,会马上计算Cp、Cpk,或者画控制图。

但这里有一个容易被忽略的问题。

假设某个产品真实的尺寸分布其实很集中,可是量具本身重复测量的波动很大。

测量以后,我们看到的数据分布就会变宽。

这时计算出来的Cpk可能降低。

工程师看到结果后,很容易判断:

「生产过程波动太大,需要改善。」

但真实情况可能是:

生产过程没有那么差,是测量系统让它看起来更差。

同样的问题也会影响SPC。

控制图出现的波动,有一部分来自真正的过程变异,还有一部分可能来自测量系统。

如果测量误差过大,质量人员就可能对正常过程作出错误反应。

因此,在重要的过程能力分析、SPC监控和改善项目中,确认测量系统的可靠性是非常重要的一步。

三、观察到的总变异,不等于产品真实变异

优思学院课程把这个关系进一步用方差模型表达:

σ²TV = σ²PV + σ²MV

其中:

σ²TV:观察到的总变异(Total Variation)
σ²PV:实际产品变异(Part Variation)
σ²MV:测量系统产生的变异(Measurement Variation)

MSA认识测量变异

这个关系揭示了MSA中一个非常关键的统计思想:

测量系统本身也是变异来源。

假设产品真实分布原本位于LSL和USL之间。

如果测量系统再加入一层额外变异,最终观察到的分布就会变宽。

于是,一些实际合格的产品可能因为测量误差而落到规格界限之外,被误判成不良品。

反过来也可能发生:

实际已经超出规格的产品,因为测量误差而被误判为合格。

所以测量系统不好,造成的不只是「数据不漂亮」。

它可能直接影响:

  • 产品放行;
  • 报废和返工;
  • 供应商判定;
  • 客户验收;
  • 过程能力分析;
  • SPC控制;
  • 六西格玛项目的原因分析。

四、MSA中的Accuracy和Precision有什么区别?

理解MSA时,一个很重要的基础是区分准确性(Accuracy)精密性(Precision)

两者经常被混在一起。

优思学院课程使用射箭靶子的方式来解释这个问题。

测量变异和准确性

可以把每一次测量结果想象成射在靶上的一支箭。

箭与箭之间是否集中,代表Precision。

箭群整体是否接近真实中心,则与Accuracy有关。

1. 精密,而且准确

多次测量结果非常集中,同时也接近真实值。

这是最理想的状态。

例如标准件真实值是50.000 mm,多次测量结果可能集中在:

49.999、50.001、50.000、50.001 mm。

数据既集中,也接近真实值。

2. 不精密,但整体位置准确

如果测量结果分布很散,但整体围绕真实值波动,平均位置可能仍然接近真实值。

这种系统的问题不是中心位置,而是重复测量的一致性不足。

3. 精密,但不准确

这是MSA中特别值得注意的一种情况。

多次测量非常集中,但整体偏离真实值。

例如一个50.000 mm的标准件,每次几乎都测到50.080 mm。

测量系统非常稳定。

但它在:

稳定地测错。

这种中心位置与参考值之间的系统性差异,就涉及偏倚(Bias)

4. 不精密,也不准确

数据既分散,又偏离真实值。

这种测量系统同时存在明显的精密性和准确性问题,自然很难支持可靠的质量判断。

五、MSA主要分析哪几种测量系统特性?

完整的计量型MSA通常不会只看一个指标。

常见的几个核心概念包括:

  • 偏倚(Bias);
  • 线性(Linearity);
  • 稳定性(Stability);
  • 重复性(Repeatability);
  • 再现性(Reproducibility)。

其中重复性和再现性经常合在一起研究,也就是大家最常听到的:

Gage R&R,简称GRR。

六、什么是偏倚Bias?

偏倚描述的是:

测量结果的平均值与参考值之间存在多大的系统性差异。

假设一个经过可靠标准设备确认的标准件真实参考值为:

50.000 mm

使用生产现场的量具重复测量多次以后,平均结果为:

50.060 mm

那么可以理解为测量系统存在约+0.060 mm的偏倚。

值得注意的是,Bias不是看某一次测量偏高或偏低,而是看重复测量后的平均位置是否系统性偏离参考值

如果发现明显偏倚,常见检查方向包括:

  • 量具是否正确校准;
  • 零点是否存在偏移;
  • 标准件参考值是否可靠;
  • 测量基准是否一致;
  • 量具是否磨损;
  • 操作方法是否造成固定方向的误差。

七、什么是Linearity线性?

一把量具在某个位置测得准确,不代表它在整个量程内都同样准确。

这就是为什么MSA还要研究线性(Linearity)

线性关注的是:

Bias是否随着被测量数值的大小而发生系统性变化。

例如一把0~100 mm的量具:

测10 mm时偏差很小;
测30 mm时偏高0.01 mm;
测60 mm时偏高0.03 mm;
测90 mm时偏高0.06 mm。

这时问题已经不只是单纯存在固定Bias。

偏差似乎随着量程增加而越来越大。

这就是需要进一步检查的线性问题。

进行Linearity Study时,通常会选择多个覆盖测量范围的参考件,对每个参考值重复测量,再观察Bias与参考值之间是否存在明显的系统性关系。

如果偏倚随量程明显变化,可能需要检查量具的校准、机械结构、传感器特性或不同量程范围的性能。

八、什么是Stability稳定性?

一个测量系统今天表现很好,不代表三个月以后还一样。

MSA中的稳定性关注的是:

测量系统的表现是否会随着时间发生变化。

例如使用同一个标准件,今天测量是50.000 mm,一个月后平均变成50.020 mm,再过一个月变成50.040 mm。

如果这种变化具有持续趋势,就可能说明测量系统正在发生漂移。

可能原因包括:

  • 量具磨损;
  • 传感器老化;
  • 环境温度变化;
  • 校准状态改变;
  • 测量设备零点漂移;
  • 长期使用造成机械变化。

稳定性研究通常需要在一段时间内持续测量同一个参考件,再通过控制图等方法观察系统随时间是否保持稳定。

九、什么是Repeatability重复性?

重复性研究的是:

同一个操作人员,使用同一个量具,对同一个产品重复测量时产生的变异。

例如:

同一名检验员使用同一把千分尺,对同一个零件连续测量三次:

20.01 mm
20.04 mm
19.99 mm

这些测量之间的差异,就包含重复性变异。

在Gage R&R分析中,Repeatability也经常称为:

Equipment Variation,EV。

不过EV高并不一定可以简单理解成「一定是量具坏了」。

实际原因还可能涉及:

  • 量具分辨率不足;
  • 夹紧力度变化;
  • 测量位置不同;
  • 产品固定方式不同;
  • 测量方法本身不稳定;
  • 环境条件变化。

所以发现重复性问题以后,需要结合现场测量过程进一步分析。

十、什么是Reproducibility再现性?

再现性关注的是:

不同评价者或操作人员使用同一测量系统时,测量结果是否存在系统性差异。

例如:

操作员A平均测量结果为50.01 mm;
操作员B平均为50.06 mm;
操作员C平均为49.98 mm。

如果不同人员之间长期存在明显差异,就说明测量结果可能受到评价者影响。

在传统Gage R&R分析中,这部分通常称为:

Appraiser Variation,AV。

造成再现性问题的常见原因包括:

  • 不同操作员使用不同测量手法;
  • 测量基准理解不一致;
  • 夹持力度不同;
  • 读数方式不同;
  • SOP描述不够清楚;
  • 操作培训不足。

十一、GRR是什么?

GRR是Gage Repeatability and Reproducibility的简称。

它把重复性和再现性结合起来,用来评估测量系统产生的变异相对于整体变异到底有多大。

可以简单理解成:

GRR越大,代表测量系统加入的数据噪声越多。

如果两个产品的真实差异很小,而测量系统自己的波动却很大,测量设备就可能无法可靠区分这两个产品。

这也是为什么GRR不是单纯讨论「量具精度是多少」。

它关心的是整个测量系统在真实使用环境下,能否可靠识别产品之间真正存在的差异。

十二、一个标准的Gage R&R研究怎么做?

经典的Crossed Gage R&R研究通常会安排:

  • 选择一组能够代表实际过程变异范围的零件;
  • 安排多名实际参与测量的评价者;
  • 每位评价者对每个零件进行多次重复测量;
  • 尽量随机化测量顺序;
  • 避免评价者知道前一次测量结果。

常见设计是:

10个零件 × 3名评价者 × 每人重复测量2~3次。

这里很容易出现一个错误:

为了做GRR,专门挑10个几乎完全一样的零件。

这样虽然看起来比较「公平」,但可能导致研究中的Part-to-Part Variation过小,反而影响测量系统区分能力的判断。

做MSA研究时,样品应该尽可能代表实际生产过程中真实可能出现的变异范围。

十三、GRR报告中的%Contribution是什么意思?

在Minitab等统计软件的Gage R&R输出中,经常会同时出现几个百分比。

它们不能混在一起理解。

%Contribution反映的是各变异来源的方差分量占总方差的比例。

例如总变异中:

多少来自Part-to-Part;
多少来自Repeatability;
多少来自Reproducibility。

它特别适合帮助分析:

主要的变异来源到底在哪里。

十四、%Study Variation是什么意思?

%Study Variation是实际工作中非常常见的GRR评价指标。

它比较的是测量系统变异相对于研究中总变异的大小。

也就是说,它在回答:

我们观察到的整体波动中,测量系统本身的波动到底占了多大的相对范围?

常见的经验性评价框架是:

  • GRR低于10%:测量系统通常表现较好;
  • 10%~30%:需要结合测量用途、产品风险、改善成本等判断是否可以接受;
  • 高于30%:通常表示测量系统需要进一步改善。

不过这里特别需要注意:

10%和30%不是脱离情境就可以机械使用的「合格/不合格红线」。

一个用于安全关键特性的测量系统,和一个用于低风险过程监控的测量系统,对测量能力的要求可能不同。

十五、%Tolerance又是什么?

%Tolerance关注的是:

测量系统的变异相对于产品规格公差到底有多大。

这和%Study Variation的视角不同。

%Study Variation关注当前研究中的过程变异。

%Tolerance则把测量系统与规格宽度联系起来。

因此,不建议只看到一个GRR百分比就立即下结论。

需要先确认:

这个百分比到底是%Contribution、%Study Variation还是%Tolerance。

三者回答的不是完全相同的问题。

十六、NDC是什么?为什么GRR之外还要看NDC?

NDC是Number of Distinct Categories的简称,中文常译为可区分类别数

它反映的是:

测量系统能够把实际产品差异分辨成多少个不同层级。

如果NDC很低,代表测量系统虽然可以给出数字,但区分不同产品状态的能力有限。

例如一个测量系统面对实际不同的产品,却只能模糊地区分成「比较高」和「比较低」两类,那么它对过程改善和SPC的帮助就会受到限制。

在实际MSA分析中,经常把:

NDC达到5或以上

作为一个重要参考。

NDC越高,通常说明测量系统相对于实际产品变异具有更好的分辨能力。

十七、为什么GRR看起来不错,NDC却可能低于5?

这是做MSA时非常常见的问题。

出现这种情况,不一定代表量具突然出了问题。

一个重要原因可能是:

你拿来做GRR研究的零件彼此太相似。

NDC与产品之间的实际变异有关。

如果研究中的10个样品全部集中在非常窄的范围内,那么Part-to-Part Variation很小,测量系统自然比较难把它们分成多个明显类别。

因此看到NDC很低时,可以检查:

  • 样品是否覆盖真实过程范围;
  • 是否为了做MSA刻意选了太相似的零件;
  • 量具分辨率是否足够;
  • 测量系统变异是否真的过大。

这也说明:

好的MSA研究设计,比单纯按软件按钮更加重要。

十八、Crossed Gage R&R和Nested Gage R&R有什么区别?

大多数常规尺寸测量会使用Crossed Gage R&R

它的特点是:

同一个零件可以由不同评价者重复测量。

例如一个金属零件可以交给操作员A、B、C分别测量,每个人都可以反复测同一个零件。

但有些测试是破坏性的。

例如:

  • 拉伸测试;
  • 破坏强度测试;
  • 某些化学检验;
  • 需要消耗样品的实验。

一个样品测试完成以后就不能重新交给其他操作人员测量。

这种情况下,Crossed设计可能无法成立。

就需要考虑Nested Gage R&R等更符合实际测试结构的方法。

所以选择哪一种GRR方法,不应该只看软件菜单,而要先理解:

同一个样品能不能由不同评价者重复测量。

十九、计量型MSA和计数型MSA有什么区别?

前面讨论的大部分内容,都属于计量型测量系统

例如:

长度、重量、压力、温度、硬度、时间。

这些测量结果是连续数值,可以进行GRR、Bias、Linearity和Stability等分析。

但现实中还有另一类测量系统:

计数型或属性型判断。

例如:

OK / NG;
合格 / 不合格;
划伤 / 无划伤;
等级A / B / C。

这种情况下,不能直接套用计量型Gage R&R的方法。

我们更关注的是:

不同评价者之间是否判断一致?

同一个评价者重复判断是否一致?

他们与标准答案之间是否一致?

这属于Attribute Agreement Analysis等属性型测量系统分析的范畴。

二十、Minitab做Gage R&R时要看什么?

使用Minitab进行Gage R&R分析时,不应该只找到一个「%GRR」数字就结束。

一份有意义的分析通常需要结合多个结果。

常见需要查看的内容包括:

  • Total Gage R&R;
  • Repeatability;
  • Reproducibility;
  • Part-to-Part Variation;
  • %Contribution;
  • %Study Variation;
  • %Tolerance;
  • NDC;
  • 不同零件的测量分布;
  • 不同评价者之间的差异;
  • 相关图表是否显示异常模式。

真正重要的不是:

「GRR到底是8.6%还是11.2%?」

而是进一步问:

测量系统的主要问题来自哪里?它是否足以影响我们的质量判断?

二十一、GRR不理想时应该怎么改善?

GRR不理想时,不建议第一反应就是:

「买一台更贵的量具。」

更合理的做法,是先判断变异来源。

如果重复性问题比较明显

可以检查:

  • 量具的分辨率是否适合当前公差;
  • 量具是否磨损;
  • 产品定位方式是否稳定;
  • 测量位置是否统一;
  • 夹持力度是否一致;
  • 环境条件是否影响结果。

如果再现性问题比较明显

可以检查:

  • 不同人员是否采用同样的测量方法;
  • SOP是否明确;
  • 测量基准是否统一;
  • 员工是否经过一致的培训;
  • 是否存在主观读数问题。

如果Bias明显

应进一步检查:

  • 校准状态;
  • 参考标准;
  • 零点;
  • 固定方向的操作偏差;
  • 量具系统性误差。

如果Linearity存在问题

需要检查测量系统是否在不同量程范围内具有不同程度的Bias。

如果Stability存在问题

则应该把重点放在:

时间、磨损、环境、设备漂移和校准周期。

二十二、MSA最容易犯的几个错误

第一个错误,是认为校准合格就等于MSA合格。

校准非常重要,但校准和MSA并不是同一件事。

一台设备即使校准状态正常,在真实现场使用时仍可能因为人员、方法和环境产生很大的测量变异。

第二个错误,是只看GRR,不看NDC。

一个测量系统真正有没有能力区分不同产品,还需要结合Part-to-Part Variation和NDC理解。

第三个错误,是只看一个百分比。

%Contribution、%Study Variation和%Tolerance的含义并不相同。

第四个错误,是GRR样品选得太集中。

样品没有代表实际过程范围,会让研究结果失去一部分实际意义。

第五个错误,是把所有问题都归咎于量具。

MSA分析的是测量系统,而测量系统包括的不只是仪器。

人员、方法、产品定位和环境同样可能是主要变异来源。

二十三、MSA与六西格玛DMAIC有什么关系?

MSA通常是六西格玛DMAIC中Measure阶段的重要工具。

Measure阶段的任务并不只是「收集数据」。

更重要的是确认:

这些数据能不能真实地描述我们正在研究的问题。

如果测量系统不可靠,Analyze阶段使用假设检验、ANOVA、回归分析等方法时,结论也可能受到影响。

到了Improve阶段,即使真的找到改善方案,如果测量系统噪声过大,也可能无法可靠判断改善前后究竟有没有真正变化。

所以MSA实际上贯穿了整个数据分析逻辑。

优思学院在六西格玛课程中把测量变异放在MSA学习的重要位置,就是希望学员在使用统计工具之前先建立这个意识:

数据不是现实本身,数据只是我们通过测量系统观察现实以后得到的结果。

二十四、MSA到底想解决什么问题?

把Bias、Linearity、Stability、Repeatability、Reproducibility、GRR和NDC全部学完以后,MSA最终还是回到一个很简单的问题:

我能不能相信这个测量结果?

当两个产品测出来不同,我们希望确认它们是真的不同。

当控制图出现异常,我们希望确认异常真的来自过程。

当Cpk下降,我们希望确认过程真的变差。

当一个产品被判定超出规格,我们也希望确认它是真的超规格,而不是测量系统把它推到了规格线之外。

所以MSA不是单纯的量具管理。

它真正保护的是:

质量决策的可靠性。

二十五、MSA常见问题FAQ

GRR多少算合格?

常见参考是GRR低于10%通常代表测量系统表现较好;10%~30%需要结合测量用途、风险和成本进一步判断;高于30%通常需要考虑改善。但在实际应用中,不应脱离测量特性的重要程度机械使用百分比。

GRR合格,NDC低于5怎么办?

可以先检查研究样品是否覆盖真实的过程变异。如果样品彼此太相似,Part-to-Part Variation过小,就可能造成NDC偏低。同时也需要检查量具分辨率和测量系统本身的变异。

Bias和Linearity有什么区别?

Bias关注测量平均值与参考值之间的差异;Linearity则进一步研究Bias是否会随着测量范围改变。

重复性和再现性有什么区别?

重复性主要研究同一评价者、同一量具重复测量时产生的变异;再现性主要研究不同评价者之间是否存在测量差异。

校准通过以后还要不要做MSA?

可能仍然需要。校准主要确认设备与标准之间的关系,而MSA关注的是量具在实际使用环境中,由人员、方法、产品和设备共同形成的整个测量系统是否可靠。

为什么做Cpk之前最好确认测量系统?

因为观察到的数据变异包含产品变异和测量变异。如果测量系统本身加入太多波动,计算出来的过程能力可能无法准确反映真实过程表现。

破坏性测试可以做GRR吗?

可以研究测量系统,但研究设计与一般Crossed Gage R&R不同。如果同一个样品无法被多名评价者重复测量,就需要根据测试结构考虑Nested等研究方法。

结语:先确认尺子,再讨论产品

MSA最值得记住的并不是某一个公式。

而是一种质量管理思维:

在相信数据之前,先确认产生数据的系统是否值得相信。

产品存在变异,测量本身也存在变异。

我们最终看到的数字,是两者共同作用的结果。

只有把产品真正的变异与测量系统造成的变异尽可能区分开来,Cpk、SPC、DOE以及后续六西格玛分析才建立在更可靠的基础上。

这也是MSA在六西格玛Measure阶段如此重要的原因。