FMEA是什么?失效模式与影响分析(FMEA)完整指南

FMEA(Failure Mode and Effects Analysis,失效模式与影响分析)是一种预防性的风险分析方法。它不是等问题发生后再寻找原因,而是在产品设计、制造过程或服务流程正式运行之前,系统地思考:哪里可能失效?失效会造成什么影响?为什么会发生?现有措施能否预防或发现?哪些风险应该优先改善?本文从FMEA的基本逻辑、DFMEA与PFMEA的区别、S/O/D评分、RPN与AP,到实际制作步骤和案例,完整说明FMEA应该怎么做。

一、FMEA是什么?

FMEA的英文全称是Failure Mode and Effects Analysis,中文通常译为失效模式与影响分析。

简单理解,FMEA就是在问题真正发生以前,先把可能出现的问题系统地“预演”一遍。

它主要回答几个问题:

  • 这个产品、零件或工序应该完成什么功能?
  • 它可能以什么方式失效?
  • 一旦失效,会造成什么后果?
  • 什么原因可能导致这种失效?
  • 目前有哪些预防和探测措施?
  • 风险有多大,是否需要采取进一步行动?

因此,FMEA与一般的问题解决方法有一个很明显的区别:它强调预防,而不是等故障发生以后再改善。

例如,一家汽车零部件工厂准备导入新的螺栓锁紧工序。与其等客户投诉“螺栓松脱”以后才调查原因,不如在量产前进行PFMEA:

功能:按照规定扭矩锁紧螺栓;

失效模式:螺栓扭矩不足;

失效影响:装配松动,严重情况下可能影响产品功能或安全;

潜在原因:扭矩参数设置错误、工具异常、漏锁;

预防措施:参数权限管理、工具校准、防错设计;

探测措施:扭矩监控、自动记录、终检。

这就是FMEA最基本的思维方式。

二、什么是“失效模式”和“影响分析”?

理解FMEA,最重要的不是背定义,而是把功能、失效模式、失效影响和失效原因分清楚。

1. 功能(Function)

功能描述对象应该做什么。

例如:

轴承应该支撑旋转轴并保持稳定旋转;

密封圈应该防止液体泄漏;

焊接工序应该按照规定位置和强度完成连接。

如果功能本身没有定义清楚,后面的FMEA往往也很难做好。

2. 失效模式(Failure Mode)

失效模式描述功能是怎样没有达到要求的。

例如密封圈的功能是“防止液体泄漏”,那么可能的失效模式包括:

  • 密封不完全;
  • 密封圈破损;
  • 密封圈脱落;
  • 密封位置错误。

“操作员没有培训”通常不能直接写成失效模式,因为它更接近失效原因。

3. 失效影响(Failure Effect)

失效影响回答的是:

“如果这个失效真的发生,会怎么样?”

仍以密封失效为例,其影响可能是:

液体泄漏 → 设备性能下降 → 客户无法正常使用。

分析影响时不要只停留在本工序,而要考虑下一工序、整机以及最终用户可能受到的影响。

4. 失效原因(Failure Cause)

失效原因回答:

“为什么会发生这个失效模式?”

例如“密封不完全”的潜在原因可能包括尺寸偏差、安装位置错误、材料硬度异常或装配压力不足。

这里有一个非常实用的判断方法:

影响看失效之后发生什么,原因看失效之前发生了什么。

把这条逻辑弄清楚,FMEA表格中最容易混淆的三个栏目——Failure Effect、Failure Mode、Failure Cause——基本就能区分开。

三、FMEA有哪些主要类型?

实际工作中最常见的是DFMEA和PFMEA。

DFMEA:设计FMEA

DFMEA(Design FMEA)关注产品设计本身可能产生的风险。

例如:

材料强度是否不足?

尺寸公差设计是否合理?

零件在极端温度下是否可能失效?

接口设计是否可能导致错误装配?

DFMEA的重点不是生产线有没有按照要求制造,而是:即使完全按照图纸生产,这个设计本身还可能出现什么问题?

PFMEA:过程FMEA

PFMEA(Process FMEA)关注的是制造或业务过程如何产生失效。

例如:

零件会不会装反?

焊接温度是否可能过低?

操作员是否可能漏装零件?

加工尺寸是否可能超差?

错误产品有没有可能流入下一工序?

所以,同一个产品可能同时需要DFMEA和PFMEA,而且两者之间应该存在逻辑联系。

简单来说:

DFMEA主要问“产品设计可能怎么出问题”,PFMEA主要问“生产过程可能怎么把产品做错”。

四、FMEA中的S、O、D是什么意思?

传统FMEA通常从三个维度评价风险:

S(Severity):严重度

O(Occurrence):发生度

D(Detection):探测度

常见评分体系采用1~10等级,但具体评分不能只凭个人感觉,应按照企业采用的FMEA手册、客户要求或行业标准中的评价准则执行。

严重度S:后果有多严重?

Severity关注失效影响的严重程度。

也就是说,S评价的是Effect,而不是Cause。

如果某个失效只是导致外观轻微瑕疵,其严重度通常不会与导致关键功能丧失、安全风险或法规问题的失效处于同一级别。

因此,严重度不是看“这个问题容易不容易发生”,而是看:

一旦发生,后果有多严重?

发生度O:原因发生的可能性有多高?

Occurrence评价潜在失效原因发生的可能性。

判断O时,应尽量利用实际数据,例如历史不良率、设备能力、可靠性数据、类似产品经验和现有预防控制,而不是单纯依赖团队成员的印象。

探测度D:现有控制有多大把握发现问题?

Detection关注现有探测控制发现失效原因或失效模式的能力。

这里最容易理解反:

D数值越高,通常表示越难被探测,而不是探测能力越强。

例如一个错误只能依靠操作员偶尔目视发现,探测能力可能比较弱;如果设备能够自动检测并阻止不合格品继续流转,探测能力通常更强。

FMEA强调的也不只是“检查更多”。相比在最后增加一道检验,更理想的方向往往是从源头预防失效原因,例如防错、设计更改、参数锁定或提高过程能力。

五、RPN是什么?是不是越高就越危险?

传统FMEA中经常使用RPN(Risk Priority Number,风险优先数):

RPN = S × O × D

假设某项风险的评分为:

S = 8
O = 5
D = 6

那么:

RPN = 8 × 5 × 6 = 240

RPN可以帮助团队比较风险,但不能简单理解成“只要RPN低于某个固定数字就安全”。

原因在于,不同的S、O、D组合可能得到相同的RPN。

例如:

9 × 2 × 4 = 72

4 × 6 × 3 = 72

两个RPN都是72,但前者的严重度为9,后者只有4。两种风险显然不能仅仅因为RPN相同就采取完全一样的处理方式。

因此,不要机械设定一个RPN门槛,然后把低于门槛的项目全部忽略。

尤其是涉及安全、法规或重大客户影响的高严重度项目,更应该单独关注。

六、AP是什么?为什么AIAG & VDA FMEA不再只看RPN?

汽车行业目前常见的AIAG & VDA FMEA方法引入了Action Priority(AP,措施优先级)。

AP同样考虑S、O、D,但并不是简单把三个数字相乘,而是按照规定的组合逻辑确定措施优先级,并更加重视严重度。

AP通常分为:

  • H:High,高措施优先级;
  • M:Medium,中措施优先级;
  • L:Low,低措施优先级。

需要特别注意:AP表达的是采取进一步风险降低措施的优先程度,不应该简单翻译成“高风险、中风险、低风险”。

这也是新方法相对于单纯RPN思维的重要变化。

所以,如果企业采用AIAG & VDA体系,不应该自行用“RPN超过100就改善”之类的规则替代正式的AP评价逻辑。

七、FMEA应该怎么做?

如果按照AIAG & VDA FMEA的结构化方法,可以把分析过程理解为七个步骤。

第一步:策划与准备

先确定分析对象、边界、项目范围、团队成员和已有资料。

FMEA通常不适合一个质量工程师独自坐在电脑前完成。

比较有效的FMEA团队往往来自设计、制造、质量、设备、工艺、采购、售后等不同职能,因为不同角色看到的风险并不一样。

第二步:结构分析

把分析对象逐层拆解。

对于DFMEA,可以从系统、子系统一直拆到零部件。

对于PFMEA,可以从整个制造过程拆到工序、工步和过程要素。

结构分析解决的是:

“我们到底在分析什么,它与上下层对象是什么关系?”

第三步:功能分析

明确每个对象应该完成什么功能,以及相应的要求是什么。

例如不要只写“钻孔”,而应该进一步明确:

“在指定位置加工直径10±0.1 mm的孔。”

功能和要求越清楚,后续识别失效模式越容易。

第四步:失效分析

建立:

失效影响(FE)→ 失效模式(FM)→ 失效原因(FC)

之间的逻辑关系。

以钻孔为例:

功能要求:孔径10±0.1 mm;

失效模式:孔径过大;

失效影响:配合松动;

潜在原因:刀具磨损、刀具选择错误、加工参数异常等。

问题就在这里:好的FMEA不是尽可能多填几行,而是把功能—失效—影响—原因之间的因果关系建立清楚。

第五步:风险分析

识别现有预防控制和探测控制,并评价S、O、D以及相应的AP。

传统体系中也可能同时计算RPN。

如果分析过程中发现很多评分都是凭经验“拍数字”,通常说明团队应该回头寻找历史数据、试验结果、过程表现或其他证据。

第六步:优化

FMEA真正产生价值的地方就在这里。

对于需要进一步降低风险的项目,应确定改善措施、负责人和完成时间。

改善可以考虑:

  • 修改产品设计;
  • 消除潜在失效原因;
  • 增加防错设计;
  • 改善工艺参数;
  • 降低变异;
  • 提高预防控制能力;
  • 改善自动探测或在线监控。

措施实施以后,应重新评价相关风险,而不是在“建议措施”栏写一句“加强员工培训”就结束。

第七步:结果文件化

记录分析结果、已采取措施、风险变化和相关决策。

更重要的是,FMEA应该随着设计变更、工艺变化、客户投诉、质量事故和新经验持续更新。

FMEA不是量产前填完以后永久封存的表格。

八、用一个PFMEA案例看懂完整逻辑

假设一家工厂有一道轴承压装工序。

要求是:轴承必须按照规定方向压入,并达到规定位置。

团队可能识别出以下风险:

功能:正确安装轴承。

失效模式:轴承安装方向错误。

失效影响:产品运行异常,可能出现噪声、寿命下降甚至功能失效。

失效原因:零件可以反向放入夹具,操作员上料方向错误。

现有预防控制:作业指导书和员工培训。

现有探测控制:操作员目视确认方向。

团队分析后发现,仅依赖人员识别方向并不可靠。

于是采取改善措施:

重新设计定位夹具,使反向放置时零件无法进入。

这就是典型的Poka-Yoke(防错)思路。

改善之后,错误装配的发生可能性明显下降。

这个案例也说明了FMEA一个非常重要的原则:

能够预防错误发生,通常比依赖后端检查发现错误更有效。

九、FMEA、鱼骨图和5 Why有什么区别?

这几个工具经常同时出现在六西格玛和质量改善项目中,但用途并不相同。

FMEA偏向事前风险识别:问题还没有发生,就分析哪里可能失败以及应该怎样预防。

鱼骨图偏向原因展开:针对一个已经明确的问题,从人员、设备、材料、方法、环境等角度系统寻找潜在原因。

5 Why则强调沿着因果关系继续追问,帮助团队从表面现象深入到可行动的根本原因。

因此,它们并不是互相替代的工具。

实际项目中完全可能先通过FMEA发现某个高优先级风险,再使用鱼骨图或5 Why深入分析其潜在原因。

十、做好FMEA最常见的几个误区

误区1:把FMEA当成质量部门的表格

如果只是质量工程师参考旧文件复制一份FMEA,再把日期和产品型号修改一下,文件可能完成了,但风险分析并没有真正发生。

FMEA本质上是跨职能团队进行风险思考的过程,表格只是记录结果的载体。

误区2:先评分,再想风险

有些团队打开FMEA以后马上讨论“S到底是7还是8”。

真正应该先讨论的是功能、失效模式、影响和原因。

因果链都没有分析清楚,评分再精确也没有太大意义。

误区3:把原因写成“员工不小心”

这种原因几乎无法产生有效改善。

更有价值的问题是:

为什么操作员能够装错?

为什么夹具允许错误方向进入?

为什么参数能够被随意修改?

为什么漏装以后设备仍然可以启动?

当原因描述到可以采取工程措施的程度,FMEA才真正具有改善价值。

误区4:只追求降低D

增加检验确实可能改善探测能力,但产品已经做错以后再把它检查出来,并不是最理想的风险控制方式。

如果能够通过设计、工艺、防错或过程控制降低O,让失效原因根本不发生,通常更符合FMEA的预防思想。

误区5:FMEA做完就不更新

如果发生客户投诉,而FMEA里完全没有对应风险,应该把实际经验反馈到FMEA。

设计修改、设备更换、工艺参数改变、新供应商导入以及新的失效经验,也都可能成为重新评审FMEA的触发点。

十一、FMEA与控制计划、SPC、MSA是什么关系?

在制造业质量管理中,FMEA通常不是孤立存在的。

PFMEA识别出重要的过程风险以后,其中的关键产品特性、过程特性以及预防和探测控制,可以进一步与控制计划建立联系。

如果某项风险需要通过过程数据持续监控,就可能使用SPC控制图。

如果风险控制依赖测量结果,则还要考虑测量系统本身是否可靠,这就涉及MSA、GRR等方法。

因此可以把它理解成一条风险管理逻辑:

FMEA识别“哪里可能出问题” → 确定需要什么控制 → 控制计划落实控制方法 → SPC等工具监控过程表现 → 实际异常和经验再反馈给FMEA。

十二、什么时候应该做FMEA?

FMEA最有价值的时间并不是产品已经大量生产以后,而是仍然有机会以较低成本修改设计和过程的时候。

常见应用时机包括:

  • 开发新产品;
  • 设计新的生产过程;
  • 现有产品或过程发生重大变更;
  • 将成熟设计应用到新的环境或用途;
  • 导入新设备、新材料或新供应商;
  • 出现新的客户投诉或现场失效经验;
  • 对现有过程进行系统性风险复审。

越晚发现风险,修改设计、调整设备、处理库存甚至召回产品的成本往往越高。

这也是FMEA作为预防性质量工具最核心的商业价值。

十三、怎样判断一份FMEA做得好不好?

不要只看表格有多少行,也不要只看是不是每个格子都填满。

更值得检查的是:

  • 功能和要求是否具体;
  • 失效模式是否真正描述了功能如何失败;
  • 影响是否考虑下一层级和最终用户;
  • 原因是否具体到能够采取行动;
  • 预防控制与探测控制是否被正确区分;
  • S、O、D评分是否有合理依据;
  • 高措施优先级项目是否真正得到处理;
  • 改善措施是否有负责人和完成时间;
  • 措施实施以后是否重新评价;
  • 现场经验是否持续反馈到FMEA。

真正成熟的FMEA不会给人一种“表格填得很完整”的感觉,而是能够清楚回答:

我们最担心什么?为什么担心?现在如何控制?还准备做什么?

十四、FMEA真正的价值不是算RPN,而是提前消除风险

很多人第一次学习FMEA,会把注意力集中在S、O、D怎么打分,以及RPN怎么算。

这些当然重要,但它们不是FMEA的核心。

FMEA真正有价值的部分,是让团队在产品交到客户手上之前、生产问题大规模发生之前,系统地发现潜在风险,并把有限的工程资源投入到更值得改善的地方。

换句话说,一份优秀的FMEA不是“预测问题的清单”,而是一套推动风险降低的工作逻辑。

当团队能够把“功能 → 失效模式 → 失效影响 → 失效原因 → 现有控制 → 风险评价 → 改善措施”完整连接起来,FMEA才真正从一张质量表格变成风险管理工具。

对于希望系统掌握FMEA,并进一步理解DMAIC、过程能力、MSA、SPC、假设检验、DOE等方法的质量工程师和管理人员,可以通过六西格玛绿带课程建立更完整的质量改善与数据分析知识体系。优思学院长期提供六西格玛、精益及质量管理相关培训,课程内容强调工具背后的分析逻辑以及实际工作中的应用,而不仅是记忆定义和公式。