
在学习SPC控制图时,我们很快会遇到一堆看起来有点像「口诀」的规则:
一个点超过3σ。
连续9点位于中心线同一侧。
连续6点不断上升或下降。
连续14点上下交替。
连续3点中有2点超过2σ。
连续5点中有4点超过1σ。
这些规则到底是谁定的?
为什么偏偏是6点、9点、14点?
更重要的是:
是不是违反任何一条规则,就代表生产过程出了问题?
要真正理解这些问题,就不能只背规则,而要回到SPC控制图发展的历史。
因为今天我们熟悉的各种判异规则,其实经历了一条很清楚的演进路线:
Shewhart → Western Electric → Nelson → 现代SPC软件
它们一直在解决同一个问题:
怎样尽早发现真正的过程变化,同时又不要把正常的随机波动误认为异常?
这才是控制图判异规则真正的核心。
一、故事要从Shewhart和控制图说起
20世纪初,大规模工业生产迅速发展。
传统质量管理主要依靠最终检验。
产品生产出来以后进行检查,好的留下,不好的挑出来。
这种方法有一个明显问题:
发现问题的时候,产品可能已经生产了一大批。
真正更有价值的问题应该是:
能不能在生产过程中,就发现过程正在发生变化?
1920年代,Walter A. Shewhart开始系统研究这个问题。
1924年前后,他提出了后来成为统计过程控制基础的控制图(Control Chart)思想。
Shewhart带来的最大突破,其实并不是「画一张图」,而是对变异(Variation)的理解。
他认为过程中的变异应该区分为不同性质。
一种来自过程本身长期存在的随机因素,我们今天通常称为:
Common Cause——普通原因。
另一种来自某些可以识别的异常因素,例如机器故障、材料变化、刀具损坏、参数错误、操作方式变化等,称为:
Assignable Cause / Special Cause——可归属原因或特殊原因。
这两个概念非常重要。
因为生产数据有波动,并不代表过程出了问题。
假设某零件目标尺寸是50.00 mm。
连续测量得到:
49.98
50.02
50.01
49.97
50.03
49.99
数据一直在变化。
但这种变化可能只是过程本身正常存在的随机波动。
SPC真正想知道的是:
什么时候这种变化已经大到让我们有理由怀疑,过程背后的机制发生了改变?
控制图就是为了回答这个问题而出现的。
二、为什么控制界限通常放在±3σ?
Shewhart控制图最经典的设计,就是:
中心线 CL
以及:
上控制界限 UCL = +3σ
下控制界限 LCL = −3σ
为什么是3σ?
如果一个稳定过程近似服从正态分布,那么大约99.73%的数据会位于:
−3σ 到 +3σ
之间。
换句话说,一个完全正常的过程,某个数据点单纯因为随机波动而跑到±3σ之外的概率大约只有:
0.27%
也就是:
P(|Z| > 3)≈ 0.0027
反过来计算:
1 ÷ 0.0027 ≈ 370
因此,一个完全稳定的过程,如果持续采样,平均大约每370个数据点,也可能单纯因为随机波动出现一次超过±3σ控制界限的情况。
这个概念可以用ARL(Average Run Length,平均运行长度)来描述。
对于经典的3σ Shewhart控制图:
ARL₀ ≈ 370
这里千万不要理解成:
「第370个点一定会超限。」
不是。
它只是长期平均。
有可能第50个点就随机越界,也可能观察1000个点才遇到一次。
所以控制图从来没有说:
「超过UCL = 100%证明机器坏了。」
它真正表达的是:
「如果过程真的没有发生变化,这种现象出现的概率已经比较低,因此值得调查。」
这两句话看起来很接近,统计意义却完全不同。
三、只看3σ,很快又出现一个问题
假设某过程原来的平均值是50。
后来因为刀具磨损、温度变化或设备设定改变,平均值慢慢变成50.5。
过程其实已经发生偏移。
但偏移并不一定大到让数据马上超过3σ控制界限。
于是控制图可能出现这样的情况:
所有点都没有超过UCL或LCL。
如果只按照:
「超过控制界限才算异常」
工程师可能会认为过程完全正常。
可是仔细看图,却发现最近十几个数据点几乎全部位于中心线上方。
这就产生了一个非常重要的问题:
单个数据点看起来都正常,但一连串数据形成的模式,会不会已经不正常?
答案是:
会。
这正是Western Electric Rules出现的重要背景。
四、1956年:Western Electric把控制图判读标准化
Western Electric与SPC的发展有很深的历史关系。
1956年,Western Electric Company出版了经典的:
《Statistical Quality Control Handbook》
这本手册系统整理了Western Electric在统计质量控制实践中积累的方法和经验。
后来其中关于控制图特殊原因判定的规则,被广泛称为:
Western Electric Rules
或者:
WECO Rules
它的贡献非常重要。
过去我们主要问:
「这个点有没有超过3σ?」
Western Electric进一步开始问:
「最近这一串点的排列方式,像不像随机产生的?」
五、Western Electric为什么要把控制图分成A、B、C区?
为了更容易识别这些模式,控制图从中心线到3σ之间被进一步划分。
通常表示为:
Zone C:0~1σ
Zone B:1~2σ
Zone A:2~3σ
再往外,就是超过3σ控制界限。
于是工程师不再只是看到:
「超界」和「没有超界」。
而是可以观察:
数据究竟离中心线有多远,以及连续的数据组合起来出现在哪里。
经典Western Electric规则通常包括以下几种情况。
规则一:一个点超过3σ
这是最直接的异常信号。
如果过程本来稳定,单个点随机超过±3σ的概率大约只有0.27%。
规则二:连续3点中有2点位于同一侧2σ之外
虽然没有任何一个点超过3σ,但连续出现这样的组合,已经值得怀疑。
规则三:连续5点中有4点位于同一侧1σ之外
每个点单独拿出来看都没有问题。
但组合起来看,就不像典型的随机分布。
规则四:连续多个点全部位于中心线同一侧
这可能意味着过程平均值已经发生偏移。
Western Electric Rules最大的意义就在这里:
控制图从「单点异常检测」,进一步走向了「连续数据模式识别」。
六、为什么连续很多点在中心线同一侧值得怀疑?
这个逻辑其实非常容易理解。
假设过程真的稳定,而且数据围绕中心线随机波动。
一个数据点落在中心线上方的概率大约是:
50%
连续两个点都在上方:
0.5 × 0.5 = 0.25
也就是25%。
连续三个点都在上方:
0.5 × 0.5 × 0.5 = 0.125
也就是12.5%。
随着连续点数增加,这种排列纯粹由随机产生的概率会越来越低。
而且还要考虑所有点都在下面的情况。
所以我们关心的不是:
「某一个数据点是否离中心线特别远?」
而是:
「这么多数据连续以同一种方式排列,究竟还像不像随机波动?」
这就是Runs Rules背后的基本统计思想。
七、1984年:Nelson Rules进一步扩展
Western Electric Rules已经非常有用,但人们逐渐发现:
控制图上的非随机模式远不止「靠近控制界限」或「长期偏在一边」。
1984年,Lloyd S. Nelson在《Journal of Quality Technology》发表:
《The Shewhart Control Chart—Tests for Special Causes》
Nelson并不是推翻Western Electric。
更准确地说,他是在原有Shewhart控制图以及Western Electric判异思想基础上,进一步整理和扩展对特殊原因模式的识别。
后来逐渐形成我们今天熟悉的:
Nelson Rules。
如果Western Electric强调:
Zone + 连续点组合
那么Nelson进一步加入了更多:
Pattern——模式。
连续6点不断上升或下降
这可能代表某个因素正在持续变化。
例如:
刀具逐渐磨损;
温度不断上升;
设备逐渐漂移;
原料性质持续改变。
连续14点上下交替
这种非常规律的「一高一低、一高一低」,反而不像真正随机的数据。
背后可能存在两套操作方式、两台设备轮流生产、两个测量人员交替测量等系统性因素。
连续很多点过度集中在中心线附近
很多人第一次学习SPC时会觉得:
「这不是很好吗?数据全部靠近平均值。」
未必。
如果根据过去过程估计出来的σ是正确的,数据应该自然分散在不同区域。
如果大量数据异常集中在中心线附近,也可能说明:
数据来自不同的分层方式;
抽样方法改变;
测量分辨率存在问题;
或者控制界限已经不适合当前过程。
所以:
控制图中的「异常」不等于「数据很差」。
异常真正的意思是:
数据表现出来的模式,与我们原来假设的稳定随机过程不一致。
八、Western Electric与Nelson不是两个竞争门派
这一点很容易被教材讲复杂。
其实它们的历史关系可以简单理解成:
1920年代——Shewhart
建立控制图思想。
核心问题:
过程波动到底来自普通原因还是特殊原因?
↓
1956——Western Electric
把Shewhart思想进一步标准化、工业化。
不只看单点3σ越界,还观察Zone和连续数据组合。
↓
1984——Nelson
进一步扩展Special Cause的识别模式。
加入趋势、交替、异常集中等模式。
↓
现代SPC软件
把这些思想直接做成:
Test 1、Test 2、Test 3……
所以今天很多工程师其实仍然在使用这些思想,只是不一定会说:
「我正在使用Western Electric Rules。」
九、为什么Minitab里面会看到Test 1、Test 2、Test 3?
如果使用Minitab绘制控制图,经常会看到:
Test 1
一个点超过中心线3个标准差。
Test 2
连续9点位于中心线同一侧。
Test 3
连续6点持续增加或持续减少。
Test 4
连续14点上下交替。
看到这些规则时,其实已经能明显看到Nelson Rules的影子。
这说明现代SPC并没有抛弃这些老规则。
相反:
它们已经被软件化了。
十、是不是规则开得越多越好?
这是应用SPC时最容易犯的错误之一。
很多人第一次看到Nelson有8条规则,会想:
「那就全部打开,不就最安全吗?」
听起来很合理。
实际上未必。
因为任何统计判异规则都会面对两个问题:
Detection——发现真正变化
以及:
False Alarm——误报
如果规则比较宽松,好处是误报少。
坏处是过程已经发生小幅变化,可能很久以后才发现。
如果规则非常敏感,好处是很快发现小变化。
坏处是正常的随机波动也更容易触发警报。
这就是SPC判异规则最核心的权衡:
灵敏度越高,不代表管理效果一定越好。
因为误报本身也有成本。
十一、为什么误报多了反而危险?
假设一条生产线每天产生几百个SPC数据点。
公司又把所有Western Electric、Nelson Rules全部打开。
于是系统不断报警:
「Special Cause!」
工程师过去调查。
没有找到原因。
过几个小时又报警。
再次调查。
还是没有发现问题。
久而久之,现场人员很容易产生一种心理:
「SPC又乱报警了。」
真正异常出现时,反而没人认真对待。
这就是典型的「狼来了」。
更严重的是,有些操作人员看到控制图发出信号,会立刻调整机器。
调一点。
下一次又报警。
再调一点。
如果原来的过程其实是稳定的,这些人为调整反而会把额外变异带进过程。
这恰恰违反了Shewhart控制图最原始的精神。
十二、控制图报警,不代表产品不合格
这是SPC教学中必须反复强调的一点。
控制界限不是规格界限。
Specification Limits回答的是:
产品是否满足客户或设计要求?
Control Limits回答的是:
过程目前的行为是否与过去稳定状态一致?
完全是两个不同的问题。
因此,一个数据点超过UCL:
不代表这个产品一定不合格。
同样:
所有点都位于UCL和LCL之间,
也不代表产品一定符合规格。
例如客户规格是:
49.90~50.10 mm
但过程长期稳定在:
50.15 mm附近
控制图可能非常漂亮。
所有点都在控制界限里面。
可是产品全部偏离客户规格。
这是一个:
稳定,但没有能力满足要求的过程。
所以:
SPC首先解决的是稳定性问题,Cp、Cpk等过程能力分析才进一步讨论过程满足规格的能力。
两者不能混为一谈。
十三、被判定为「异常」,一定是坏事吗?
也不一定。
这是理解Special Cause非常重要的一点。
假设某条生产线过去的不良率长期维持在5%左右。
经过改善以后,不良率突然下降到1%,而且连续很多点都维持在新的水平。
控制图很可能报警。
为什么?
因为:
过程发生变化了。
但这明显是一个好变化。
所以控制图所谓的「异常」并不是:
Bad。
而更接近:
Different。
也就是说:
现在的数据已经不像原来那个稳定过程产生的数据。
如果变化是坏的,我们应该找到原因并消除。
如果变化是好的,我们反而更应该找到原因:
到底做对了什么?
可能换了更好的材料。
可能新的设备参数更稳定。
可能某位操作员采用了更好的方法。
可能新的治具降低了定位误差。
找到原因以后,把它标准化,新的改善才真正能够维持。
这也是持续改善与SPC连接起来的地方。
十四、实际应用SPC判异规则,要注意哪些事情?
1. 先确认控制图选对了
不同数据类型需要不同控制图。
连续型数据可能使用:
Xbar-R、Xbar-S、I-MR。
计数型数据可能使用:
p、np、c、u控制图。
控制图本身选择错误,后面的判异规则再漂亮也没有意义。
2. 不要把规格界限当成控制界限
USL、LSL来自设计或客户要求。
UCL、LCL来自过程数据。
一个属于:
Voice of Customer
一个属于:
Voice of Process
概念一定要分开。
3. 不要看到一个信号就立刻调机器
控制图的作用是:
发出调查信号。
不是:
自动下达调机命令。
应该结合生产记录、设备状态、原材料、人员、测量系统和现场条件寻找Special Cause。
4. 不一定要把所有判异规则全部打开
规则应该根据:
过程风险、采样频率、变化速度、误报成本以及希望检测的变化类型进行选择。
有些过程只使用基本规则已经足够。
有些关键过程则需要增加对小偏移更加敏感的规则。
5. 找到特殊原因以后要留下知识
如果发现某次异常是因为:
换了供应商;
设备温度异常;
刀具寿命达到极限;
操作方式改变;
测量仪器漂移;
这些信息不应该只停留在一张异常处理单里面。
应该进一步进入:
标准作业、控制计划、FMEA、设备保养、供应商管理或企业经验数据库。
这样SPC才真正从「画图工具」变成「过程学习工具」。
十五、SPC真正要学的,不是八条口诀
Western Electric Rules已经有70年的历史。
Nelson Rules也已经有40多年。
为什么今天还在使用?
因为它们背后的问题从来没有消失:
怎样判断数据变化究竟是随机波动,还是过程真的发生了变化?
Shewhart最早给出了一个非常漂亮的答案:
用控制图区分普通原因和特殊原因。
Western Electric继续往前走了一步:
不要只看单个点,还要观察连续数据形成的模式。
Nelson再进一步:
趋势、交替、集中、分层等非随机模式,同样可能透露过程发生了变化。
现代统计软件把这些思想变成Test 1、Test 2、Test 3……
表面上看,工具越来越复杂。
但SPC最重要的思想其实一直没有变。
不要因为数据动了一下就调整过程,也不要等到产品大量不良才承认过程出了问题。
控制图真正要做的,是帮助我们在两者之间找到一个合理的判断边界。
所以学习SPC时,与其死背「连续几点」「超过几个σ」,更应该理解这些数字背后的统计逻辑:
每一条判异规则,本质上都在寻找那些「如果过程真的稳定,就不太容易随机出现」的数据模式。
一旦这种模式出现,我们得到的不是「过程一定有问题」的结论,而是一个值得调查的信号。
这才是SPC控制图判异规则真正的价值。
优思学院原创






