SPC控制图判异规则的起源和应用要点

在学习SPC控制图时,我们很快会遇到一堆看起来有点像「口诀」的规则:

一个点超过3σ。

连续9点位于中心线同一侧。

连续6点不断上升或下降。

连续14点上下交替。

连续3点中有2点超过2σ。

连续5点中有4点超过1σ。

这些规则到底是谁定的?

为什么偏偏是6点、9点、14点?

更重要的是:

是不是违反任何一条规则,就代表生产过程出了问题?

要真正理解这些问题,就不能只背规则,而要回到SPC控制图发展的历史。

因为今天我们熟悉的各种判异规则,其实经历了一条很清楚的演进路线:

Shewhart → Western Electric → Nelson → 现代SPC软件

它们一直在解决同一个问题:

怎样尽早发现真正的过程变化,同时又不要把正常的随机波动误认为异常?

这才是控制图判异规则真正的核心。

一、故事要从Shewhart和控制图说起

20世纪初,大规模工业生产迅速发展。

传统质量管理主要依靠最终检验。

产品生产出来以后进行检查,好的留下,不好的挑出来。

这种方法有一个明显问题:

发现问题的时候,产品可能已经生产了一大批。

真正更有价值的问题应该是:

能不能在生产过程中,就发现过程正在发生变化?

1920年代,Walter A. Shewhart开始系统研究这个问题。

1924年前后,他提出了后来成为统计过程控制基础的控制图(Control Chart)思想。

Shewhart带来的最大突破,其实并不是「画一张图」,而是对变异(Variation)的理解。

他认为过程中的变异应该区分为不同性质。

一种来自过程本身长期存在的随机因素,我们今天通常称为:

Common Cause——普通原因。

另一种来自某些可以识别的异常因素,例如机器故障、材料变化、刀具损坏、参数错误、操作方式变化等,称为:

Assignable Cause / Special Cause——可归属原因或特殊原因。

这两个概念非常重要。

因为生产数据有波动,并不代表过程出了问题。

假设某零件目标尺寸是50.00 mm。

连续测量得到:

49.98
50.02
50.01
49.97
50.03
49.99

数据一直在变化。

但这种变化可能只是过程本身正常存在的随机波动。

SPC真正想知道的是:

什么时候这种变化已经大到让我们有理由怀疑,过程背后的机制发生了改变?

控制图就是为了回答这个问题而出现的。

二、为什么控制界限通常放在±3σ?

Shewhart控制图最经典的设计,就是:

中心线 CL

以及:

上控制界限 UCL = +3σ

下控制界限 LCL = −3σ

为什么是3σ?

如果一个稳定过程近似服从正态分布,那么大约99.73%的数据会位于:

−3σ 到 +3σ

之间。

换句话说,一个完全正常的过程,某个数据点单纯因为随机波动而跑到±3σ之外的概率大约只有:

0.27%

也就是:

P(|Z| > 3)≈ 0.0027

反过来计算:

1 ÷ 0.0027 ≈ 370

因此,一个完全稳定的过程,如果持续采样,平均大约每370个数据点,也可能单纯因为随机波动出现一次超过±3σ控制界限的情况。

这个概念可以用ARL(Average Run Length,平均运行长度)来描述。

对于经典的3σ Shewhart控制图:

ARL₀ ≈ 370

这里千万不要理解成:

「第370个点一定会超限。」

不是。

它只是长期平均。

有可能第50个点就随机越界,也可能观察1000个点才遇到一次。

所以控制图从来没有说:

「超过UCL = 100%证明机器坏了。」

它真正表达的是:

「如果过程真的没有发生变化,这种现象出现的概率已经比较低,因此值得调查。」

这两句话看起来很接近,统计意义却完全不同。

三、只看3σ,很快又出现一个问题

假设某过程原来的平均值是50。

后来因为刀具磨损、温度变化或设备设定改变,平均值慢慢变成50.5。

过程其实已经发生偏移。

但偏移并不一定大到让数据马上超过3σ控制界限。

于是控制图可能出现这样的情况:

所有点都没有超过UCL或LCL。

如果只按照:

「超过控制界限才算异常」

工程师可能会认为过程完全正常。

可是仔细看图,却发现最近十几个数据点几乎全部位于中心线上方。

这就产生了一个非常重要的问题:

单个数据点看起来都正常,但一连串数据形成的模式,会不会已经不正常?

答案是:

会。

这正是Western Electric Rules出现的重要背景。

四、1956年:Western Electric把控制图判读标准化

Western Electric与SPC的发展有很深的历史关系。

1956年,Western Electric Company出版了经典的:

《Statistical Quality Control Handbook》

这本手册系统整理了Western Electric在统计质量控制实践中积累的方法和经验。

后来其中关于控制图特殊原因判定的规则,被广泛称为:

Western Electric Rules

或者:

WECO Rules

它的贡献非常重要。

过去我们主要问:

「这个点有没有超过3σ?」

Western Electric进一步开始问:

「最近这一串点的排列方式,像不像随机产生的?」

五、Western Electric为什么要把控制图分成A、B、C区?

为了更容易识别这些模式,控制图从中心线到3σ之间被进一步划分。

通常表示为:

Zone C:0~1σ

Zone B:1~2σ

Zone A:2~3σ

再往外,就是超过3σ控制界限。

于是工程师不再只是看到:

「超界」和「没有超界」。

而是可以观察:

数据究竟离中心线有多远,以及连续的数据组合起来出现在哪里。

经典Western Electric规则通常包括以下几种情况。

规则一:一个点超过3σ

这是最直接的异常信号。

如果过程本来稳定,单个点随机超过±3σ的概率大约只有0.27%。

规则二:连续3点中有2点位于同一侧2σ之外

虽然没有任何一个点超过3σ,但连续出现这样的组合,已经值得怀疑。

规则三:连续5点中有4点位于同一侧1σ之外

每个点单独拿出来看都没有问题。

但组合起来看,就不像典型的随机分布。

规则四:连续多个点全部位于中心线同一侧

这可能意味着过程平均值已经发生偏移。

Western Electric Rules最大的意义就在这里:

控制图从「单点异常检测」,进一步走向了「连续数据模式识别」。

六、为什么连续很多点在中心线同一侧值得怀疑?

这个逻辑其实非常容易理解。

假设过程真的稳定,而且数据围绕中心线随机波动。

一个数据点落在中心线上方的概率大约是:

50%

连续两个点都在上方:

0.5 × 0.5 = 0.25

也就是25%。

连续三个点都在上方:

0.5 × 0.5 × 0.5 = 0.125

也就是12.5%。

随着连续点数增加,这种排列纯粹由随机产生的概率会越来越低。

而且还要考虑所有点都在下面的情况。

所以我们关心的不是:

「某一个数据点是否离中心线特别远?」

而是:

「这么多数据连续以同一种方式排列,究竟还像不像随机波动?」

这就是Runs Rules背后的基本统计思想。

七、1984年:Nelson Rules进一步扩展

Western Electric Rules已经非常有用,但人们逐渐发现:

控制图上的非随机模式远不止「靠近控制界限」或「长期偏在一边」。

1984年,Lloyd S. Nelson在《Journal of Quality Technology》发表:

《The Shewhart Control Chart—Tests for Special Causes》

Nelson并不是推翻Western Electric。

更准确地说,他是在原有Shewhart控制图以及Western Electric判异思想基础上,进一步整理和扩展对特殊原因模式的识别。

后来逐渐形成我们今天熟悉的:

Nelson Rules。

如果Western Electric强调:

Zone + 连续点组合

那么Nelson进一步加入了更多:

Pattern——模式。

连续6点不断上升或下降

这可能代表某个因素正在持续变化。

例如:

刀具逐渐磨损;

温度不断上升;

设备逐渐漂移;

原料性质持续改变。

连续14点上下交替

这种非常规律的「一高一低、一高一低」,反而不像真正随机的数据。

背后可能存在两套操作方式、两台设备轮流生产、两个测量人员交替测量等系统性因素。

连续很多点过度集中在中心线附近

很多人第一次学习SPC时会觉得:

「这不是很好吗?数据全部靠近平均值。」

未必。

如果根据过去过程估计出来的σ是正确的,数据应该自然分散在不同区域。

如果大量数据异常集中在中心线附近,也可能说明:

数据来自不同的分层方式;

抽样方法改变;

测量分辨率存在问题;

或者控制界限已经不适合当前过程。

所以:

控制图中的「异常」不等于「数据很差」。

异常真正的意思是:

数据表现出来的模式,与我们原来假设的稳定随机过程不一致。

八、Western Electric与Nelson不是两个竞争门派

这一点很容易被教材讲复杂。

其实它们的历史关系可以简单理解成:

1920年代——Shewhart

建立控制图思想。

核心问题:

过程波动到底来自普通原因还是特殊原因?

1956——Western Electric

把Shewhart思想进一步标准化、工业化。

不只看单点3σ越界,还观察Zone和连续数据组合。

1984——Nelson

进一步扩展Special Cause的识别模式。

加入趋势、交替、异常集中等模式。

现代SPC软件

把这些思想直接做成:

Test 1、Test 2、Test 3……

所以今天很多工程师其实仍然在使用这些思想,只是不一定会说:

「我正在使用Western Electric Rules。」

九、为什么Minitab里面会看到Test 1、Test 2、Test 3?

如果使用Minitab绘制控制图,经常会看到:

Test 1

一个点超过中心线3个标准差。

Test 2

连续9点位于中心线同一侧。

Test 3

连续6点持续增加或持续减少。

Test 4

连续14点上下交替。

看到这些规则时,其实已经能明显看到Nelson Rules的影子。

这说明现代SPC并没有抛弃这些老规则。

相反:

它们已经被软件化了。

十、是不是规则开得越多越好?

这是应用SPC时最容易犯的错误之一。

很多人第一次看到Nelson有8条规则,会想:

「那就全部打开,不就最安全吗?」

听起来很合理。

实际上未必。

因为任何统计判异规则都会面对两个问题:

Detection——发现真正变化

以及:

False Alarm——误报

如果规则比较宽松,好处是误报少。

坏处是过程已经发生小幅变化,可能很久以后才发现。

如果规则非常敏感,好处是很快发现小变化。

坏处是正常的随机波动也更容易触发警报。

这就是SPC判异规则最核心的权衡:

灵敏度越高,不代表管理效果一定越好。

因为误报本身也有成本。

十一、为什么误报多了反而危险?

假设一条生产线每天产生几百个SPC数据点。

公司又把所有Western Electric、Nelson Rules全部打开。

于是系统不断报警:

「Special Cause!」

工程师过去调查。

没有找到原因。

过几个小时又报警。

再次调查。

还是没有发现问题。

久而久之,现场人员很容易产生一种心理:

「SPC又乱报警了。」

真正异常出现时,反而没人认真对待。

这就是典型的「狼来了」。

更严重的是,有些操作人员看到控制图发出信号,会立刻调整机器。

调一点。

下一次又报警。

再调一点。

如果原来的过程其实是稳定的,这些人为调整反而会把额外变异带进过程。

这恰恰违反了Shewhart控制图最原始的精神。

十二、控制图报警,不代表产品不合格

这是SPC教学中必须反复强调的一点。

控制界限不是规格界限。

Specification Limits回答的是:

产品是否满足客户或设计要求?

Control Limits回答的是:

过程目前的行为是否与过去稳定状态一致?

完全是两个不同的问题。

因此,一个数据点超过UCL:

不代表这个产品一定不合格。

同样:

所有点都位于UCL和LCL之间,

也不代表产品一定符合规格。

例如客户规格是:

49.90~50.10 mm

但过程长期稳定在:

50.15 mm附近

控制图可能非常漂亮。

所有点都在控制界限里面。

可是产品全部偏离客户规格。

这是一个:

稳定,但没有能力满足要求的过程。

所以:

SPC首先解决的是稳定性问题,Cp、Cpk等过程能力分析才进一步讨论过程满足规格的能力。

两者不能混为一谈。

十三、被判定为「异常」,一定是坏事吗?

也不一定。

这是理解Special Cause非常重要的一点。

假设某条生产线过去的不良率长期维持在5%左右。

经过改善以后,不良率突然下降到1%,而且连续很多点都维持在新的水平。

控制图很可能报警。

为什么?

因为:

过程发生变化了。

但这明显是一个好变化。

所以控制图所谓的「异常」并不是:

Bad。

而更接近:

Different。

也就是说:

现在的数据已经不像原来那个稳定过程产生的数据。

如果变化是坏的,我们应该找到原因并消除。

如果变化是好的,我们反而更应该找到原因:

到底做对了什么?

可能换了更好的材料。

可能新的设备参数更稳定。

可能某位操作员采用了更好的方法。

可能新的治具降低了定位误差。

找到原因以后,把它标准化,新的改善才真正能够维持。

这也是持续改善与SPC连接起来的地方。

十四、实际应用SPC判异规则,要注意哪些事情?

1. 先确认控制图选对了

不同数据类型需要不同控制图。

连续型数据可能使用:

Xbar-R、Xbar-S、I-MR。

计数型数据可能使用:

p、np、c、u控制图。

控制图本身选择错误,后面的判异规则再漂亮也没有意义。

2. 不要把规格界限当成控制界限

USL、LSL来自设计或客户要求。

UCL、LCL来自过程数据。

一个属于:

Voice of Customer

一个属于:

Voice of Process

概念一定要分开。

3. 不要看到一个信号就立刻调机器

控制图的作用是:

发出调查信号。

不是:

自动下达调机命令。

应该结合生产记录、设备状态、原材料、人员、测量系统和现场条件寻找Special Cause。

4. 不一定要把所有判异规则全部打开

规则应该根据:

过程风险、采样频率、变化速度、误报成本以及希望检测的变化类型进行选择。

有些过程只使用基本规则已经足够。

有些关键过程则需要增加对小偏移更加敏感的规则。

5. 找到特殊原因以后要留下知识

如果发现某次异常是因为:

换了供应商;

设备温度异常;

刀具寿命达到极限;

操作方式改变;

测量仪器漂移;

这些信息不应该只停留在一张异常处理单里面。

应该进一步进入:

标准作业、控制计划、FMEA、设备保养、供应商管理或企业经验数据库。

这样SPC才真正从「画图工具」变成「过程学习工具」。

十五、SPC真正要学的,不是八条口诀

Western Electric Rules已经有70年的历史。

Nelson Rules也已经有40多年。

为什么今天还在使用?

因为它们背后的问题从来没有消失:

怎样判断数据变化究竟是随机波动,还是过程真的发生了变化?

Shewhart最早给出了一个非常漂亮的答案:

用控制图区分普通原因和特殊原因。

Western Electric继续往前走了一步:

不要只看单个点,还要观察连续数据形成的模式。

Nelson再进一步:

趋势、交替、集中、分层等非随机模式,同样可能透露过程发生了变化。

现代统计软件把这些思想变成Test 1、Test 2、Test 3……

表面上看,工具越来越复杂。

但SPC最重要的思想其实一直没有变。

不要因为数据动了一下就调整过程,也不要等到产品大量不良才承认过程出了问题。

控制图真正要做的,是帮助我们在两者之间找到一个合理的判断边界。

所以学习SPC时,与其死背「连续几点」「超过几个σ」,更应该理解这些数字背后的统计逻辑:

每一条判异规则,本质上都在寻找那些「如果过程真的稳定,就不太容易随机出现」的数据模式。

一旦这种模式出现,我们得到的不是「过程一定有问题」的结论,而是一个值得调查的信号。

这才是SPC控制图判异规则真正的价值。


优思学院原创