
在数据分析中,我们经常会想知道两个变量之间有没有关系。例如温度升高时,产品尺寸会不会跟着变化?设备速度增加以后,不良率会不会上升?广告投入增加时,销售额会不会同步增加?
这类问题都可以先从「相关性」开始观察,而皮尔逊相关系数(Pearson Correlation Coefficient)就是最常见的工具之一。
皮尔逊相关系数通常用字母r表示,它的取值范围介于-1和1之间,用来描述两个连续变量之间线性关系的方向和强度。
如果r接近1,说明两个变量具有较强正相关;如果r接近-1,则表示较强负相关;如果r接近0,则说明没有明显的线性关系。
先用一个简单例子理解相关系数
假设我们记录一台设备每天的运行温度和产品尺寸。
如果温度越高,产品尺寸通常也越大,那么两个变量可能呈现正相关。画成散点图以后,数据点大致会从左下方向右上方延伸。
如果温度越高,产品强度反而越低,那么就是负相关,散点图可能从左上方向右下方延伸。
如果温度变化很大,但产品结果没有明显规律,那么相关系数可能接近0。
所以,相关系数最直观的意义,就是告诉我们两个变量有没有「一起变化」的趋势,以及这种趋势有多明显。
为什么相关系数会有正数和负数?
皮尔逊相关系数的核心思想,可以从每个数据点距离平均值的位置来理解。
假设一个X值高于X的平均值,同时对应的Y值也高于Y的平均值,那么两个变量的变化方向是一致的。它们各自与平均值的偏差相乘以后,会得到正数。
如果X低于平均值,而Y也低于平均值,两边偏差都是负数,负数乘负数同样得到正数。
因此,当很多数据都表现为「X高时Y也高,X低时Y也低」,最终得到的相关系数就会偏向正值。
反过来,如果X高于平均值时,Y往往低于平均值,那么两个偏差一正一负,相乘以后就是负数。这样的情况越多,相关系数就越接近-1。
皮尔逊相关系数其实是「标准化后的协方差」
从数学上看,Pearson相关系数和协方差有密切关系。
协方差可以反映两个变量是否朝相同方向变化。如果两个变量经常一起上升或一起下降,协方差通常为正;如果一个上升时另一个下降,协方差通常为负。
问题是,协方差受到测量单位影响。
例如把温度从摄氏度改成华氏度,或者把长度从毫米改成微米,协方差的数值会发生变化。这样一来,就不方便比较不同变量之间关系的强弱。
皮尔逊相关系数解决这个问题的方法,就是用两个变量各自的标准差对协方差进行标准化。
因此,可以把它简单理解为:
r = 两个变量的协方差 ÷ 两个变量标准差的乘积
经过标准化以后,结果就被限制在-1到1之间,也不再受原始测量单位影响。
r等于0.8,算不算很强?
很多人看到相关系数以后,会马上寻找一张表,例如0.7以上叫强相关,0.4到0.7叫中等相关。
这种分级可以作为参考,但不能机械使用。
不同领域对相关强度的要求差异很大。在某些社会科学研究中,r=0.5可能已经很有意义;但在一个高度精密的制造过程里,如果希望证明某个参数几乎决定产品尺寸,0.5可能远远不够。
因此,判断相关强弱时,不只是看数字,还要看具体业务背景、样本量、测量误差和实际影响。
一般来说,可以这样理解:
- r越接近1,正线性关系越明显;
- r越接近-1,负线性关系越明显;
- r越接近0,线性关系越弱。
真正重要的是「接近哪一个方向」,而不是死记某个固定分界线。
相关系数接近0,不代表两个变量完全没有关系
这是Pearson相关系数最容易被误解的地方。
它衡量的是线性关系。
如果两个变量之间存在明显的曲线关系,相关系数仍然可能接近0。
例如某个化学反应在温度过低和过高时表现都不好,中间温度反而最好。X和Y之间可能呈现明显的倒U形关系,但如果计算Pearson r,结果可能并不高。
这时候如果只看相关系数,就可能错误认为两个变量没有关系。
所以做相关分析时,优思学院建议先画散点图。图形可以帮助我们先判断关系是否大致呈线性,也能发现异常值和不同数据群组。
相关不等于因果
这是学习相关分析时最需要记住的一句话。
两个变量高度相关,并不代表其中一个一定造成另一个发生变化。
例如夏天气温越高,冰淇淋销量通常越高,同时溺水事故也可能增加。冰淇淋销量和溺水事故之间可能表现出正相关,但并不是吃冰淇淋造成溺水。
真正同时影响两者的,是天气温度。
在六西格玛项目中也一样。假设我们发现机器速度和不良率高度相关,不能马上决定降低速度。还要继续确认是否存在其他共同因素,例如产品型号、材料批次或设备负载。
所以相关分析很适合帮助我们发现值得调查的方向,但不能单独证明因果关系。
异常值可能严重影响Pearson相关系数
皮尔逊相关系数对异常值比较敏感。
假设大部分数据完全没有明显关系,但其中一个点同时具有非常大的X值和Y值,这一个异常点就可能把相关系数明显拉高。
反过来,如果原本存在明显线性关系,但出现一个远离整体趋势的异常点,也可能让r明显下降。
因此,计算相关系数以后不要只看r,还应该检查散点图。
如果发现异常值,需要判断它是真实过程现象、测量错误、录入错误,还是来自不同过程条件。不能为了让相关系数更漂亮,就直接把异常点删除。
使用Pearson相关时需要哪些条件?
Pearson相关主要适合两个连续型变量,而且两者之间应该大致呈现线性关系。
如果数据存在非常严重的异常值、明显非线性关系,或者变量本身属于等级数据,Pearson相关可能不是最适合的方法。
对于偏态数据,需要区分「计算相关系数」和「对相关系数做显著性推断」两个问题。Pearson r本身可以直接从数据计算,并不是只有正态数据才能计算;但如果样本量较小、存在严重偏态或异常值,传统显著性检验的可靠性可能受到影响。
这种情况下,可以考虑Spearman等级相关等非参数方法。
Pearson和Spearman有什么区别?
Pearson相关主要衡量线性关系,而Spearman相关更关注两个变量之间是否存在一致的单调趋势。
所谓单调趋势,就是一个变量增加时,另一个变量整体上倾向增加或倾向减少,但这种关系不一定是一条直线。
如果数据大致呈线性,而且连续型数据质量较好,Pearson通常很合适。
如果数据存在明显偏态、异常值较多、使用等级数据,或者关系明显不是线性的但仍保持单调变化,那么Spearman往往更值得考虑。
在六西格玛项目中,Pearson相关可以怎么用?
在DMAIC的Analyze阶段,项目团队经常需要研究关键输入X和关键输出Y之间有没有关系。
例如:
- 设备温度与产品尺寸是否有关;
- 压力与缺陷率是否有关;
- 生产速度与周期时间是否有关;
- 材料含水量与产品强度是否有关。
这时候,可以先通过散点图和Pearson相关系数做初步筛选。
如果某个X与Y表现出明显相关,就值得进一步分析。后续可能使用回归分析、假设检验、DOE或者现场实验来验证关系。
因此,相关分析在六西格玛中更像一个「寻找线索」的工具,而不是最终的根因证明工具。
为什么不能只看r,还要看P值?
相关系数r告诉我们样本中关系的方向和强度,但还可以进一步检验这种相关是否有足够统计证据。
例如r=0.6看起来不低,但如果只有5组数据,这个结果可能很不稳定;如果有200组数据,同样的相关程度就更有说服力。
因此,统计软件通常会同时给出P值,用来检验总体相关系数是否可以视为0。
如果P值较小,例如小于预先设定的0.05显著性水平,可以认为数据对「存在非零线性相关」提供了较强证据。
但P值小不等于关系很强。样本量非常大时,一个很小的相关系数也可能达到统计显著。
所以分析结果应该同时看r的大小、P值和实际业务意义。
一个高相关系数也不代表可以直接预测
相关分析和回归分析关系密切,但目的不同。
相关系数主要描述两个变量之间关系的强弱和方向。它不会区分谁是X、谁是Y,把X和Y交换以后,r不会改变。
回归分析则更关注利用一个或多个X解释或预测Y,并建立具体数学模型。
所以,如果项目只是想知道温度和尺寸有没有关系,相关分析可能已经足够作为初步判断;如果还希望知道温度每增加1℃,尺寸预计改变多少,就需要进一步做回归分析。
常见问题
皮尔逊相关系数的范围是多少?
r的范围是-1到1。接近1表示较强正线性相关,接近-1表示较强负线性相关,接近0表示线性关系较弱。
r等于1代表什么?
代表两个变量存在完全正线性关系,也就是说所有数据点都落在一条向上的直线上。
r等于0是不是完全没有关系?
不是。它只表示没有明显线性关系。两个变量仍然可能存在曲线或其他非线性关系。
相关系数很高,可以证明根因吗?
不能。相关只能说明变量一起变化,不能单独证明因果关系。仍然需要结合过程知识、实验或其他统计方法验证。
Pearson相关一定要求数据服从正态分布吗?
计算r本身并不要求数据必须严格服从正态分布,但进行传统显著性推断时,对数据分布和异常值会有更多要求。严重偏态或存在异常值时,可以考虑Spearman相关。
Pearson和回归分析有什么区别?
Pearson相关主要描述线性关系的方向和强度;回归分析则进一步建立X与Y之间的数学关系,可用于解释和预测。
结语
皮尔逊相关系数是一种非常基础、也非常实用的统计工具。它把两个连续变量之间的线性关系,用一个介于-1和1之间的数字表示出来。
但真正会用相关分析,不能只记住「越接近1越相关」。还要理解线性关系、异常值、样本量、P值以及相关与因果之间的区别。
优思学院认为,在六西格玛项目中,Pearson相关最适合用来帮助团队发现值得进一步调查的X,而不是直接宣布根因。
看到相关,是分析的开始;证明为什么相关,才是更重要的下一步。





