
在质量管理和六西格玛项目中,我们经常会遇到这样的问题:温度升高以后,不良率是不是也会上升?压入时间变长,会不会影响接着强度?设备速度变化,与产品尺寸波动有没有关系?
面对这类「两个变量之间有没有关系」的问题,一个非常直观的工具就是散布图(Scatter Plot,也常称散点图)。
散布图是QC七大手法之一,也经常用于六西格玛DMAIC的Analyze阶段。它把一组变量放在横轴X上,另一组变量放在纵轴Y上,再把每一对观测数据画成一个点。观察这些点的分布形态,就可以初步判断两个变量之间是否可能存在关联。
一、什么是散布图?
散布图是一种用来观察两个数值变量之间关系的图形。
假设我们想研究电镀时间是否影响电镀厚度,可以记录每一批产品的电镀时间X以及对应的厚度Y,再把每一组X、Y数据画在坐标图上。
如果随着电镀时间增加,厚度也明显增加,图上的点就可能形成由左下向右上的趋势。
又例如,我们研究:
- 压入时间与接着强度;
- 回流焊温度与焊点强度;
- 刀具使用次数与加工尺寸;
- 环境湿度与产品不良率;
- 设备速度与周期时间。
散布图最大的优势,是能够把原本隐藏在数据表格里的关系直接画出来。
有时候看100行数据很难发现规律,但画成散布图以后,趋势可能一眼就能看出来。
二、散布图不只用来研究「原因与结果」
在六西格玛中,我们经常用Y = f(X)表示过程关系。
Y是结果,例如尺寸、强度、不良率或周期时间;X则是可能影响Y的因素,例如温度、压力、时间或速度。
因此,散布图经常被用来初步观察某个X和Y之间是否存在关系。
不过,散布图并不限于「原因X与结果Y」。
我们也可以研究两个输出之间的关系,例如产品重量与产品强度;或者研究两个过程参数是否同时变化。
从统计角度来说,散布图真正回答的是:
当一个变量发生变化时,另一个变量是否表现出某种规律性的变化?
三、什么时候适合使用散布图?
散布图特别适合用在问题分析阶段。
例如项目团队通过鱼骨图提出十几个可能原因,其中怀疑「烘烤温度」可能影响产品硬度。
这时候可以把历史温度数据和对应硬度数据画成散布图,先观察两者是否存在明显趋势。
如果散布图显示温度越高,硬度普遍越高,这个因素就值得进一步分析。
如果点完全没有明显规律,则说明在目前的数据范围内,两者没有表现出明显的简单关系。
需要特别注意的是:不能因为散布图看起来相关,就直接认定X是根本原因;也不能因为看不出线性关系,就马上删除这个因素。
两者之间可能存在非线性关系,也可能受到其他变量干扰。因此,散布图通常是一种探索工具,而不是最终的因果证明。
四、散布图常见的五种形态
1. 正相关:X增加,Y也倾向增加
如果数据点大致从左下方向右上方分布,可以说两个变量表现出正向关系。
例如研究加工温度与产品膨胀量时,如果温度越高,膨胀量通常也越大,散布图便可能出现这种形态。
点越紧密地围绕某条向上倾斜的趋势线排列,通常表示线性关系越明显。
但仍然需要记住:正相关不代表「X一定导致Y」。
2. 负相关:X增加,Y倾向降低
如果数据点从左上向右下排列,则表示两个变量存在负向关系。
例如某个过程在一定范围内,设备速度越高,单件加工时间越短,就可能形成这种关系。
同样,图形只告诉我们两者一起变化,并没有自动解释为什么会发生这种变化。
3. 看不出明显关系
有些散布图看起来像一团随机分布的点,没有明显上升或下降趋势。
这种情况下,可以说数据中没有显示明显的简单线性关系。
不过,不应该马上得出「两个变量完全没有关系」的结论。
因为可能存在:
- 非线性关系;
- 样本量太少;
- 数据范围太窄;
- 测量误差太大;
- 第三个变量的影响;
- 不同群体混在一起。
所以散布图看不出趋势,通常意味着需要进一步检查,而不是简单宣布「无关」。
4. 曲线关系:不是所有关系都是直线
这是使用散布图时很容易被忽略的情况。
有些X和Y之间明明有很强的关系,却不是直线。
例如某个工艺温度过低时不良率很高,随着温度升高不良率下降;但温度继续升高以后,又因为过热导致不良率再次增加。
散布图可能形成U形。
如果只计算简单的线性相关系数,有时候结果反而接近零。
这并不代表X和Y无关,而只是说明它们之间不是简单线性关系。
5. 存在离群值
散布图还有一个非常实用的功能,就是帮助发现离群值(Outlier)。
例如大部分数据集中在某个区域,却有一个点远远落在右上角。
这个异常点可能来自:
- 数据输入错误;
- 测量错误;
- 特殊材料批次;
- 设备异常;
- 特殊操作条件;
- 真正存在的极端结果。
发现离群值以后,不应该为了让图形「更漂亮」而直接删除。
正确的做法是调查它为什么出现,再决定这个数据是否属于研究过程。
五、离群值为什么可能彻底改变结论?
假设原本有20个数据点,没有明显的正相关,但第21个数据位于非常远的右上角。
这一个点可能让整张图突然看起来出现明显的上升趋势,甚至大幅改变相关系数和回归模型。
所以在进行相关和回归分析之前,先看散布图非常重要。
统计软件可以计算一个看起来非常精确的相关系数,例如0.82,但如果这个数值主要由一个异常点造成,实际解释就完全不同。
先看图,再看统计结果,通常比只看一个数字可靠得多。
六、如何制作一张散布图?
散布图的制作并不复杂。
假设我们收集了20组数据,每一组包括烘烤温度和最终强度。
可以按照以下逻辑处理:
- 明确准备研究的两个变量;
- 确保每一个X数据都有对应的Y数据;
- 把可能的原因或预测变量放在X轴;
- 把结果变量放在Y轴;
- 将每一组X、Y数据画成一个点;
- 观察整体趋势、群组、曲线和异常点;
- 有需要时再进行相关或回归分析。
实际工作中可以使用Excel、Minitab、JMP、R或其他统计软件快速绘制。
七、散布图与相关系数有什么关系?
散布图提供的是视觉判断,而相关系数则尝试把关系强弱用数字表示。
最常见的是Pearson相关系数r,其数值介于-1与+1之间。
一般来说:
r越接近+1,线性正相关越明显;r越接近-1,线性负相关越明显;r接近0,则代表简单线性关系较弱。
不过,单独使用相关系数容易产生误判。
例如两组完全不同的数据可能拥有相近的r值,但散布图的形态完全不同;一个离群点也可能严重改变相关系数。
所以更合理的分析顺序是:
先画散布图 → 再计算相关系数 → 再结合过程知识解释。
八、相关关系不等于因果关系
这是散布图最重要的使用原则之一。
假设某公司分析员工人数与公司利润,发现员工越多的企业利润通常越高。
不能因此直接得到:
「只要增加员工,公司利润就会提高。」
因为真正的原因可能是企业规模较大,所以既有更多员工,也有更高利润。
这里存在另一个变量——企业规模。
在制造业同样如此。
如果发现环境温度与不良率正相关,也不能马上认定环境温度就是根因。也许环境温度升高的同时,设备温度也升高,而真正影响产品的是设备温度。
所以:
相关关系可以帮助我们寻找值得调查的方向,但因果关系通常需要更多证据。
九、为什么散布图很适合与鱼骨图一起使用?
鱼骨图最大的价值,是帮助团队扩大可能原因的范围。
例如一个尺寸超差问题,团队可能提出:
材料硬度、设备温度、刀具寿命、加工速度、操作人员、测量方式等多个因素。
但鱼骨图本身并不能证明这些因素是真的原因。
接下来就可以利用数据逐一验证。
如果设备温度和尺寸都是连续型数值,散布图就是一个很自然的起点。
因此可以这样理解:
鱼骨图负责提出可能原因,散布图帮助观察其中某些原因与结果是否存在关系。
再根据需要使用回归分析、假设检验或DOE进行更深入验证。
十、不要因为散布图没有关系就直接删除一个原因
这是一种常见但危险的做法。
例如团队怀疑压力X影响尺寸Y,但散布图看不出趋势,于是立即排除压力。
实际上可能存在另一种情况:
压力只有在高温时才明显影响尺寸,而低温时几乎没有效果。
如果把所有温度的数据混在一起,压力与尺寸的关系就可能被隐藏。
这就是所谓的交互作用或混杂问题。
因此,如果工程原理强烈支持某个因素可能有影响,即使简单散布图不明显,也值得进一步进行数据分层或更深入分析。
十一、多个群组混在一起也会误导散布图
假设有A、B两台设备。
A设备的数据主要集中在低X、低Y区域,B设备则集中在高X、高Y区域。
把所有数据放在一张散布图里,可能出现非常明显的正相关。
但如果分别看A机器和B机器,每一台设备内部可能根本不存在这种关系。
这说明所谓相关关系,其实只是由设备之间的差异造成。
因此,在质量分析中,经常需要按照:
- 机器;
- 班次;
- 供应商;
- 产品型号;
- 模穴;
- 材料批次;
对数据进行分层,再观察关系是否仍然存在。
十二、散布图和回归分析有什么区别?
散布图属于探索性的图形工具。
它让我们看到两个变量之间的总体形态,但不会自动给出一个完整的数学模型。
回归分析则进一步尝试建立X与Y之间的数学关系。
例如:
Y = 12.4 + 0.35X
这个模型可以进一步用于估计X变化时Y平均会怎样改变,同时还可以检验斜率是否显著、模型解释能力如何,以及残差是否符合相关假设。
因此,散布图通常是回归分析之前非常值得做的一步。
十三、在六西格玛DMAIC中,散布图通常用在哪里?
散布图最常见于Analyze阶段。
到了这个阶段,团队已经在Define阶段明确问题,在Measure阶段收集并确认数据可靠,接下来需要从潜在X中寻找真正影响Y的关键因素。
例如:
Y:产品尺寸
潜在X:温度、压力、速度、刀具寿命、材料硬度
团队可以先针对各个连续变量绘制散布图,看看有没有值得深入调查的关系。
如果发现某几个X与Y关系明显,再利用回归、假设检验或DOE进一步验证。
所以散布图最大的作用不是直接宣布「找到根因」,而是帮助团队从大量潜在因素中寻找更值得分析的方向。
十四、一个制造业实例:温度真的是尺寸超差的原因吗?
假设某注塑工序的产品长度偶尔超出规格。
团队通过鱼骨图怀疑模具温度可能是原因之一,于是收集50批产品的数据,包括模具温度X和平均产品长度Y。
画成散布图后发现:
在较低温度范围内,产品长度变化不明显;但当温度超过某个范围以后,长度开始快速增加。
这张图已经告诉团队一个重要信息:
两者可能存在关系,但它未必是简单线性的。
如果团队只计算Pearson相关系数,可能低估这种关系。
接下来可以尝试曲线回归,或者设计DOE主动改变温度和其他相关参数,进一步验证温度是否真的影响尺寸。
这就是散布图在六西格玛分析中的合理定位。
十五、散布图使用时最常见的几个错误
看到趋势就宣布找到根因。
相关并不能自动证明因果。
相关系数接近0就宣布没有关系。
可能存在曲线关系或交互作用。
忽略离群值。
异常点可能是错误数据,也可能是非常重要的特殊原因信号。
把不同过程的数据混在一起。
不同机器、班次或产品群体可能制造出虚假的相关。
只有几个数据点就得出结论。
样本太少时,散布图的形态可能非常不稳定。
只看软件给出的相关系数,不看图。
这是数据分析中非常容易犯的错误。
十六、散布图最大的优势在于「简单但信息丰富」
散布图不需要复杂计算。
只需要两列配对数据,就能够快速观察趋势、非线性、群组、异常值以及可能存在的数据结构。
这也是为什么它几十年来一直被列入QC七大手法。
对于刚开始学习质量管理的人来说,它可以训练一种非常重要的数据思维:
不要只问平均值是多少,而要问变量之间是怎样一起变化的。
结语
散布图是一种用来观察两个数值变量之间关系的基本质量工具,也是QC七大手法和六西格玛Analyze阶段中非常实用的分析方法。
它可以帮助我们发现正相关、负相关、非线性关系、不同群组以及异常点,并为后续的相关分析、回归分析、假设检验和DOE提供方向。
但优思学院认为,学习散布图最重要的并不是学会「看到向上的点就叫正相关」。
真正重要的是理解:
散布图能够告诉我们两个变量怎样一起变化,却不能单凭一张图证明其中一个变量导致另一个变量发生变化。
在实际质量改善中,更合理的思路应该是:
提出可能原因 → 收集可靠数据 → 用散布图观察关系 → 结合统计分析与工程知识验证 → 再决定改善措施。
当能够这样使用散布图时,它就不只是一张简单的QC图表,而会成为从经验判断走向数据验证的一座桥梁。





