
学习统计过程控制(SPC)时,最重要的概念之一,是区分共同原因变异与特殊原因变异。这项区分决定了管理者应该调查某次异常,还是重新设计整个过程。
很多人把它简单理解为:
- 控制界限以内的是共同原因;
- 控制界限以外的是特殊原因。
这种说法适合入门,却不够准确。控制图上的信号只能提示过程可能发生了变化,不能自动告诉我们真正原因。反过来,一个数据点没有超出控制界限,也不代表过程一定没有特殊原因。
要正确使用控制图,必须先理解这些术语的来源、统计含义和管理责任。
一、从休哈特控制图说起
Walter A. Shewhart(休哈特)在贝尔实验室工作期间研究工业过程中的波动,并于1924年提出控制图。后来这种图表也被称为休哈特控制图(Shewhart Control Chart)。
休哈特观察到,任何过程都会产生变异,但变异的性质并不完全相同。他早期使用两组术语区分它们:
- 机会原因(Chance Causes):长期存在于过程中的许多微小变异来源;
- 可归属原因(Assignable Causes):由某项可识别变化引起的异常变异来源。
W. Edwards Deming(戴明)后来在传播统计过程控制和管理思想时,广泛使用了另一组名称:
- 共同原因(Common Causes);
- 特殊原因(Special Causes)。
在今天的SPC教材、标准和实际应用中,通常把「机会原因」与「共同原因」视为相对应的概念,把「可归属原因」与「特殊原因」视为相对应的概念。它们在历史语境和管理解释上可能略有侧重,但不宜把它们描述成两套完全不同、彼此不等价的分类系统。
二、什么是共同原因变异?
共同原因变异,是过程在现有条件下长期存在的自然波动。它来自许多持续作用于系统的因素,每个因素的影响可能很小,但合在一起形成了过程当前的变异水平。
例如一个机加工过程中的共同原因可能包括:
- 设备本身的正常微小振动;
- 材料性质在允许范围内的细微差异;
- 环境温度的日常变化;
- 量具和测量方法的正常重复性误差;
- 操作方法中长期存在的小幅差异;
- 当前工艺、培训和维护制度所形成的系统表现。
当过程只受到共同原因影响时,它的平均水平和波动范围能够在一段时间内保持相对稳定。我们称这种状态为统计受控、稳定或可预测。
这里的「可预测」不是说下一个产品的尺寸可以被准确预测,而是说过程的整体分布和波动范围在短期内具有一定一致性。
三、什么是特殊原因变异?
特殊原因变异,是过程发生某项非惯常变化后产生的信号。这种变化并不是过程原有稳定模式的一部分,通常具有局部、间歇或突发特征。
常见例子包括:
- 刀具突然破损;
- 使用了错误批次的材料;
- 设备参数被意外修改;
- 传感器或量具突然失灵;
- 夹具松动或定位发生变化;
- 新员工没有按照标准操作;
- 电压、温度或压力出现异常波动。
特殊原因出现后,过程的平均值、变异大小或数据模式可能发生改变。此时,过去的过程表现未必能够可靠预测未来,因为产生数据的系统已经发生变化。
四、两组术语应该怎样理解?
在一般SPC应用中,可以使用以下方式理解两组名称的关系:
| 休哈特早期术语 | 现代常用术语 | 主要特征 | 改善方式 |
|---|---|---|---|
| 机会原因 | 共同原因 | 长期存在于现有系统中,形成稳定的过程波动 | 改变过程设计或管理系统 |
| 可归属原因 | 特殊原因 | 过程出现非惯常变化,形成异常信号 | 调查具体变化并采取针对性行动 |
因此,原文所说「共同原因可以是机会原因,也可以是非机会原因」容易造成混淆。按照现代SPC的常用定义,共同原因通常对应机会原因,特殊原因通常对应可归属原因。
戴明的重要贡献,是把这种统计区分进一步转化为管理问题:
面对不同性质的变异,谁有能力改变产生变异的系统?
五、为什么共同原因通常需要管理层处理?
共同原因存在于整个过程系统中。如果要减少这种变异,通常需要改变设备、材料标准、工艺设计、培训、维护、供应商管理或资源配置。这些改变往往超出一线操作人员的权限。
例如某加工过程长期稳定,但尺寸波动仍然过大。操作人员每天都按照现有标准工作,也没有发现设备异常。此时如果管理者不断要求员工「小心一点」,通常不会产生持续改善。
真正可能有效的行动包括:
- 更换精度更高的设备或夹具;
- 重新设计工艺参数范围;
- 收紧关键材料特性的控制;
- 改善温湿度等环境条件;
- 建立更有效的预防维护制度;
- 改进测量系统和操作标准。
这些都是系统层面的改变,需要过程负责人和管理层协调资源。因此,戴明强调管理者必须为系统中的共同原因承担主要责任。
六、特殊原因也不一定只是操作员的责任
特殊原因通常可以追溯到某个具体时间、设备、材料或事件,因此现场人员往往最适合参与调查。但这不等于所有特殊原因都应由操作员负责,更不等于发现特殊原因后就应该追究某个人。
例如刀具突然断裂可能是具体事件,但进一步分析后,原因可能是企业没有制定合理的刀具寿命标准;员工使用错误材料,也可能与物料标识、防错和仓库管理有关。
所以责任分工不能机械地理解为:
- 共同原因归管理层;
- 特殊原因归操作员。
更准确的说法是:
特殊原因需要在最接近事件、具备知识和权限的层级进行调查;如果调查发现系统设计有缺陷,管理层仍然需要承担改善责任。
七、控制界限以内不一定代表只有共同原因
控制图并不是只检查数据点有没有超出控制上限和控制下限。特殊原因有时不会产生单点越界,而会表现为连续偏向中心线一侧、持续上升、周期变化或其他非随机模式。
因此,企业还会使用Western Electric规则、Nelson规则或适合自身过程的判异规则来识别信号。
例如连续多个数据点都位于中心线同一侧,即使每一点都没有越过控制界限,也可能表示过程平均值已经移动。
同样地,一个点超出三西格玛控制界限,也不能在逻辑上证明特殊原因一定存在。即使过程完全稳定,随机数据仍有很小概率越界。以常见的三西格玛界限为例,在简化独立正态假设下,单个点落在界限外的概率约为0.27%,平均约每370个点可能出现一次误报。
所以控制图提供的是调查信号,而不是根本原因的自动诊断结果。
八、先消除特殊原因,还是先改善共同原因?
面对一个不稳定过程,通常应该先调查重要的特殊原因,使过程恢复到相对稳定的状态。原因很实际:如果过程模式不断改变,团队很难准确估计当前平均值、标准差和过程能力,也难以判断某项改善是否真正有效。
不过,这不是绝对要求企业必须等到所有异常完全消失,才可以开展任何改善。如果特殊原因本身就是造成重大损失的问题,找出并消除它就是改善项目的一部分。
两类行动可以这样区分:
- 处理特殊原因:寻找发生了什么不同,恢复或重新建立稳定过程;
- 减少共同原因:改变现有系统,使稳定过程达到更高水平。
处理特殊原因更像是找出异常变化;减少共同原因则需要重新设计过程。前者通常针对某个具体事件,后者往往需要管理决策、资源投入和实验验证。
九、过程稳定不等于过程能力足够
这是SPC中最容易混淆的地方之一。
控制界限来自过程数据,用来描述过程实际怎样波动;规格界限来自客户、设计或法规要求,用来说明结果允许落在什么范围。两者来源不同,不能互相代替。
| 比较项目 | 控制界限 | 规格界限 |
|---|---|---|
| 来源 | 根据过程数据计算 | 由客户、设计或法规确定 |
| 回答的问题 | 过程是否稳定,是否出现异常信号 | 产品或服务是否满足要求 |
| 主要用途 | 识别过程变化 | 判断符合性及过程能力 |
一个过程可能非常稳定,却持续生产大量超规格产品。例如灌装过程长期稳定在平均490毫升,但产品规格要求为500±5毫升。即使控制图没有任何异常信号,这个过程仍然没有能力满足规格。
反过来,一个不稳定过程也可能暂时所有产品都在规格范围内,但由于过程存在特殊原因,其未来表现难以预测,不能因为当前没有不良品就认为过程没有问题。
十、为什么「符合规格」还不够?
工程规格非常重要,但如果管理者只在产品超规格时才采取行动,往往会错过改善过程的机会。
假设某个尺寸要求为10.00±0.10毫米。过程A的产品大多集中在9.99至10.01毫米;过程B则分布在9.91至10.09毫米。两者目前都可能符合规格,但过程A的波动明显较小,对材料、环境和设备变化也拥有更大的余量。
这不代表企业应该在没有经济依据的情况下无限减少所有变异。改善仍然需要考虑客户价值、风险、成本和技术可行性。正确的目标不是盲目追求数值最小,而是建立稳定而有能力的过程,并持续减少真正影响客户和经营结果的变异。
十一、管理者最容易犯的两类错误
如果不能区别共同原因和特殊原因,管理者容易采取错误行动。
1. 把共同原因当成特殊原因
当过程本来稳定,管理者却因为某一天结果稍高或稍低便要求员工调机、追责或改变方法,这种过度反应会把额外波动带入过程。在SPC中,这类行为常被称为干预或过度调整(Tampering)。
2. 把特殊原因当成共同原因
当控制图已经出现明显信号,管理者却把它解释为「正常波动」,继续维持原有做法,便可能让设备故障、材料异常或方法变化持续造成损失。
控制图的管理价值,就是帮助团队在这两种错误之间作出更合理的判断:该调查时及时调查,该改变系统时不要把责任推给个别员工。
结论:理解变异,才能知道应该采取什么行动
共同原因与特殊原因的区分,不只是统计名词,也是一种重要的管理思维。机会原因与共同原因通常描述系统固有的稳定变异;可归属原因与特殊原因则描述过程出现的非惯常变化。
控制图的作用不是直接判断产品是否符合规格,也不会自动说出根本原因。它帮助管理者判断过程是否仍然保持原有模式,并提示什么时候值得调查特殊事件,什么时候需要从系统层面重新设计过程。
真正有效的SPC管理,需要把控制图信号、现场知识、测量系统、工程分析和管理责任结合起来。这样才能避免不断追逐随机波动,也不会错过真正需要处理的过程变化。




