可靠性工程与 FMEA/FTA:让问题在发生之前被解决
质量管理解决"做出来的东西合不合格",可靠性工程解决"用一段时间之后还行不行"。而 FMEA 和 FTA 提供的则是另一件事:在产品还没造出来之前,就系统地把可能的失效想一遍。这是工程领域少有的"事前算赢"工具。
一、可靠性的基本语言
可靠度 R(t)
可靠度 = 产品在规定条件下、规定时间内,完成规定功能的概率。
R(t) = P(T > t)
T = 产品寿命(失效发生的时间)
失效率 λ(t) 与浴盆曲线
失效率:工作到时刻 t 尚未失效的产品,在接下来单位时间内发生失效的概率。
典型的失效率曲线呈"浴盆形"(Bathtub Curve),分三段:
失效率 λ(t)
↑
│ 早期失效型 偶然失效型 耗损失效型
│ ╲ ╱
│ ╲ ╱
│ ╲___________________________________╱
│ (DFR) (CFR) (IFR)
└──────────────────────────────────────────→ 时间 t
早期失效期 偶然失效期 耗损失效期
( infant ( useful life )( wear-out )
mortality )
| 阶段 | 英文 | 特点 | 对策 |
|---|---|---|---|
| 早期失效期 | DFR(Decreasing Failure Rate) | 失效率随时间下降 | 早期故障主要来自设计缺陷、制造缺陷、材料问题、装配错误。对策:老化筛选(Burn-in)、早期失效分析、供应商管控 |
| 偶然失效期 | CFR(Constant Failure Rate) | 失效率近似恒定 | 由随机应力引起。对策:冗余设计、降额设计、使用维护 |
| 耗损失效期 | IFR(Increasing Failure Rate) | 失效率随时间上升 | 磨损、疲劳、老化。对策:预防性维护(PM)、定期更换、状态监测 |
工程意义:
- 出厂前做老化筛选,可以把早期失效"提前消耗掉",交到客户手上的产品处于偶然失效期
- 对耗损失效型部件,在失效率明显上升之前更换(这是 TPM 计划保全的理论基础)
指数分布模型(偶然失效期)
偶然失效期假设失效率恒定 λ:
可靠度 R(t) = e^(-λt)
失效概率 F(t) = 1 - e^(-λt)
失效率密度 f(t) = λ·e^(-λt)
平均无故障时间 MTBF = 1/λ = ∫₀^∞ R(t)dt
可靠寿命(给定可靠度 R 求时间):t_R = -ln(R) / λ
算例:某设备 MTBF = 500 小时,求工作 100 小时后的可靠度。
λ = 1/500 = 0.002 /小时
R(100) = e^(-0.002 × 100) = e^(-0.2) = 0.8187
即工作 100 小时后,约 81.9% 的设备仍能正常工作。
若要求可靠度 ≥ 95%,可工作多久?
t = -ln(0.95) / 0.002 = 0.0513 / 0.002 = 25.6 小时
这就是"可靠寿命"——它是制定维护周期的依据。
常用寿命分布
| 分布 | 适用 | 特点 |
|---|---|---|
| 指数分布 | 偶然失效期、电子元器件 | 无记忆性,λ 恒定 |
| 威布尔分布 Weibull | 最通用 | 形状参数 β 决定失效率趋势:β<1 早期失效,β=1 偶然,β>1 耗损 |
| 正态分布 | 耗损失效、机械磨损 | 对称分布 |
| 对数正态分布 | 疲劳、腐蚀 | 右偏 |
威布尔分布是可靠性工程的主力工具:
R(t) = exp[ -(t/η)^β ]
β = 形状参数(shape)
η = 尺度参数 / 特征寿命(R(η) = e^(-1) = 36.8%)
二、系统可靠度模型
串联系统
任一单元失效,系统失效。
R_s = R₁ × R₂ × ... × R_n
(指数分布、失效率恒定:λ_s = Σλ_i,MTBF_s = 1/Σλ_i)
关键洞察:串联系统里,单元越多,系统可靠度越低。
例:10 个单元串联,每个可靠度 0.99 → 系统 R = 0.99¹⁰ = 0.904 100 个单元串联,每个 0.99 → R = 0.99¹⁰⁰ = 0.366
这就是"减少零件数量"的可靠性依据——DFA(面向装配的设计)不仅降成本,还直接提升可靠性。
并联系统(冗余)
全部单元失效,系统才失效。
R_s = 1 - (1-R₁)(1-R₂)...(1-R_n)
两单元并联:R_s = 1 - (1-R)² = 2R - R²
若 R = 0.9 → R_s = 1 - 0.01 = 0.99
冗余是提升可靠度最直接的手段,代价是成本、重量、体积增加。
表决系统(k/n 系统)
n 个单元中至少 k 个正常,系统才正常。
R_s = Σ(i=k 到 n) C(n,i) · R^i · (1-R)^(n-i)
例:3 取 2 系统(n=3, k=2),R = 0.9:
R_s = C(3,2)·0.9²·0.1 + C(3,3)·0.9³
= 3 × 0.81 × 0.1 + 1 × 0.729
= 0.243 + 0.729 = 0.972
三、可用度(Availability)
可靠度关注"能撑多久",可用度关注"能用多久 / 总时间"。
固有可用度 A_i = MTBF / (MTBF + MTTR)
使用可用度 A_o = MTBF / (MTBF + MDT)
MDT = 平均停机时间 = MTTR + 平均后勤延误 + 平均管理延误
- MTBF:平均故障间隔时间(Mean Time Between Failures)
- MTTR:平均修复时间(Mean Time To Repair)
提高可用度的两条路:
- 提高 MTBF(少坏):改善设计、预防保全、可靠性增长
- 缩短 MTTR(快修):备件管理、维修标准化、模块化设计、快速诊断、远程运维
实务提醒:很多企业只盯着 MTBF,忽视了 MTTR。但缩短 MTTR 往往投入更小、见效更快——模块化设计 + 备件前置 + 维修手册标准化即可。
可靠性指标速查
| 指标 | 英文 | 公式 |
|---|---|---|
| 平均无故障时间 | MTBF | 总运行时间 / 故障次数 |
| 平均修复时间 | MTTR | 总修复时间 / 故障次数 |
| 平均首次故障时间 | MTTFF | 不可修复产品 |
| 平均故障前时间 | MTTF | 与 MTBF 常用于不同语境 |
| 可用度 | A | MTBF / (MTBF + MTTR) |
| 失效率 | λ | 1 / MTBF |
| 可靠度 | R(t) | e^(-λt)(指数分布) |
四、FMEA:失效模式与影响分析
定义与发展
FMEA(Failure Mode and Effects Analysis):系统地识别产品或过程中潜在的失效模式、评估其影响与原因、量化风险并制定措施的分析方法。
起源:1940 年代美国军方,1960 年代 NASA 用于阿波罗计划,后被汽车行业(QS-9000 → IATF 16949)推广。
新版变化:AIAG-VDA FMEA(2019)用 AP(Action Priority,行动优先级) 替代传统 RPN。
两类 FMEA
| DFMEA | PFMEA | |
|---|---|---|
| 对象 | 产品设计 | 制造/装配过程 |
| 分析什么 | 零件/子系统的功能与失效 | 工序的作业与失效 |
| 何时做 | 设计阶段(越早越好) | 过程设计阶段,量产前完成 |
| 责任人 | 设计工程师 | 工艺/制造/IE 工程师 |
| 输出 | 影响设计变更、特殊特性 | 影响控制计划、防错、SOP |
FMEA 的"七步法"(AIAG-VDA)
| 步骤 | 内容 |
|---|---|
| 1. 策划与准备 | 定义范围(5T:InTent 意图、Timing 时机、Team 团队、Task 任务、Tool 工具) |
| 2. 结构分析 | 画出结构树 / 过程流程图,拆解到最小单元 |
| 3. 功能分析 | 描述每个单元的功能与要求(用"动词 + 名词 + 可测量指标") |
| 4. 失效分析 | 识别:失效影响(FE)→ 失效模式(FM)→ 失效起因(FC) |
| 5. 风险分析 | 打分 S / O / D,确定AP(行动优先级) |
| 6. 优化 | 制定降低风险的措施,重新评估 |
| 7. 结果文件化 | 输出 FMEA 表与结论 |
失效的三层链条(关键)
失效起因 FC(Cause)
↓ 导致
失效模式 FM(Mode) ← 失效的具体表现形式
↓ 导致
失效影响 FE(Effect) ← 对客户/下工序/系统的影响
举例(PFMEA):
| 层级 | 内容 |
|---|---|
| 失效起因 | 扭矩枪设定的扭矩值错误 |
| 失效模式 | 螺栓拧紧扭矩低于规范(< 8.0 N·m) |
| 失效影响 | 装配松动 → 异响 → 客户投诉;严重情况下螺栓脱落 |
打分标准(AIAG-VDA 简化版)
严重度 S(Severity,1~10):失效影响的严重程度
| S | 描述 |
|---|---|
| 9~10 | 影响安全/法规符合性,无警告 / 非常高 |
| 7~8 | 功能丧失/严重降级,客户非常不满 |
| 4~6 | 功能降级,客户不满 |
| 2~3 | 轻微影响,部分客户察觉 |
| 1 | 无可察觉影响 |
发生度 O(Occurrence,1~10):失效起因发生的可能性
| O | 描述 |
|---|---|
| 8~10 | 很高(几乎不可避免,历史频繁发生) |
| 6~7 | 中高(同类过程经常发生) |
| 4~5 | 中等(偶尔发生) |
| 2~3 | 低(很少发生) |
| 1 | 极低(通过防错已消除) |
探测度 D(Detection,1~10):在流出前被发现的能力
| D | 描述 |
|---|---|
| 8~10 | 无法探测 / 没有控制手段 |
| 6~7 | 探测可能性低 |
| 4~5 | 中等(抽样检验) |
| 2~3 | 高(自动检测、防错装置) |
| 1 | 几乎必然探测(防错,错误不可能发生) |
RPN 与 AP
传统 RPN:
RPN = S × O × D 范围 1 ~ 1000
常见做法:RPN > 100 需采取措施;S ≥ 8 无论 RPN 都要处理。
RPN 的问题:
- 三个因子权重相同,但现实中严重度更重要
- 不同组合可能得到相同 RPN(S=10,O=1,D=10 与 S=1,O=10,D=10 都是 100,风险性质完全不同)
- 容易导致"刷分"而不是真改善
新版 AP(Action Priority):通过查表确定 H(高)/ M(中)/ L(低)优先级,且严重度 9~10 强制为高优先级。
| 行动优先级 | 含义 |
|---|---|
| H(高) | 必须采取措施降低风险 |
| M(中) | 应当采取措施 |
| L(低) | 可以采取措施(也可接受) |
降低风险的优先级
| 优先级 | 措施类型 | 效果 |
|---|---|---|
| 1(最优) | 消除失效起因(修改设计/工艺) | 降低 O |
| 2 | 防错(让失效不可能发生或立即检出) | 降低 O 或 D |
| 3 | 增加探测手段(自动检测、100% 检验) | 降低 D |
| 4(最弱) | 增加警示、培训、SOP | 效果有限 |
关键洞察:只有"修改设计/工艺"和"防错"能真正降低风险,增加检验和培训是最弱的手段。 很多组织的 FMEA 优化栏里填满了"加强培训""加强检验",这实际上是承认没有找到真正的对策。
一个简化 PFMEA 行示例
| 工序 | 功能要求 | 失效模式 | 失效影响 | S | 失效起因 | O | 现行控制 | D | RPN | AP | 建议措施 |
|---|---|---|---|---|---|---|---|---|---|---|---|
| 锁付 | 扭矩 8.0±0.5 N·m | 扭矩不足 | 松动异响 | 7 | 扭矩枪参数设定错误 | 4 | 每 2h 抽检 5 件 | 5 | 140 | H | 改用带参数锁定的数显扭矩枪 + 计数防错 |
采取措施后重新评估:O 从 4 → 2,D 从 5 → 2,RPN = 7×2×2 = 28。
FMEA 的常见失败
- 一个人关起门来填:必须跨部门团队(设计、工艺、制造、质量、维修、供应商)
- 做一次就束之高阁:FMEA 是活文件,客户投诉、内外部失效、工艺变更都要触发更新
- 罗列所有失效但都是低分:说明没分析到真正的风险点
- 优化措施全是"加强培训":说明没找到根因
- 与现场脱节:FMEA 说有 20 个高风险,现场实际发生的问题却不在表里——说明分析失效
五、FTA:故障树分析
与 FMEA 的对比
| FMEA | FTA | |
|---|---|---|
| 方向 | 自下而上(Bottom-up):从零件失效推到系统影响 | 自上而下(Top-down):从不希望发生的顶事件往下找原因 |
| 起点 | 每个组件的每个失效模式 | 一个特定的顶事件(如"刹车失效") |
| 擅长 | 穷举所有可能的失效 | 深入分析某个特定失效的所有路径 |
| 输出 | 风险清单 | 逻辑图 + 最小割集 |
实务用法:FMEA 用于全面排查,FTA 用于对高风险/安全事故的深入根因分析。
FTA 的符号
| 符号 | 名称 | 含义 |
|---|---|---|
| 与门 AND | 所有输入事件同时发生,输出才发生 | 并联(冗余)结构的失效 |
| 或门 OR | 任一输入事件发生,输出就发生 | 串联结构的失效 |
| 基本事件 | 不能再分解的底事件 | 元件失效等 |
| 未展开事件 | 信息不足暂不展开 |
定性分析:最小割集
割集:导致顶事件发生的基本事件集合。 最小割集:去掉任何一个事件就不再构成割集。
例:某系统 T = A 或 (B 且 C)
最小割集 = {A}, {B, C}
- 一阶割集 {A}:单个事件就能导致顶事件 → 高风险,优先消除
- 二阶割集 {B,C}:两个事件同时发生才导致 → 风险较低
分析结论:最小割集阶数越低、数量越多,系统越不可靠。优先消除一阶割集。
定量计算
或门(串联失效):
P(T) = 1 - Π(1 - P_i)
若概率很小,近似:P(T) ≈ ΣP_i
与门(并联失效):
P(T) = Π P_i
算例:某安全系统 T = A 或 (B 且 C),P(A)=0.01,P(B)=0.02,P(C)=0.03
P(B且C) = 0.02 × 0.03 = 0.0006
P(T) = 1 - (1-0.01)(1-0.0006) = 1 - 0.99 × 0.9994 = 1 - 0.989406 = 0.0106
六、可靠性试验与增长
常见可靠性试验
| 类型 | 目的 |
|---|---|
| 环境试验 | 高低温、湿热、盐雾、振动、冲击 |
| 寿命试验 | 在加速应力下测寿命,外推正常使用条件 |
| 加速寿命试验 ALT | 加大应力(温度、电压、振动)加速失效,用模型外推 |
| 老化筛选 Burn-in | 出厂前运行一段时间,剔除早期失效 |
| 可靠性增长试验 | 试验—分析—改进(TAAF)循环 |
加速模型举例(阿伦尼乌斯模型,温度加速):
加速因子 AF = exp[ (Ea/k) × (1/T_use - 1/T_stress) ]
Ea = 激活能(eV),k = 玻尔兹曼常数 8.617×10⁻⁵ eV/K
T 为绝对温度(K)
TAAF 循环
试验 Test → 分析 Analyze → 改进 Fix → 再试验
这是可靠性增长的基本机制,每一次循环把 MTBF 抬高一档。
七、维修性设计与 TPM 的连接
维修性(Maintainability)指标
- MTTR:平均修复时间
- 维修度 M(t):在规定条件下、规定时间内完成维修的概率
- 最大修复时间:如 95% 的维修在 X 分钟内完成
提升维修性的设计原则
- 模块化:故障模块整体更换,现场不修
- 可达性:易损件放在容易够到的位置(这是人因 + 可靠性的交叉点)
- 标准化:减少工具种类、统一紧固件
- 故障诊断能力:内置自检(BIT)、故障代码
- 防错装配:拆也只能按一种方式装回去
- 标识清晰:接线、管路有编号
与 TPM 的关系:
- 自主保全:操作工做点检、清洁、润滑、紧固——防止"强制劣化"
- 计划保全:基于 MTBF 与耗损失效规律制定维护周期,在失效率上升前更换
- 个别改善:针对 MTBF 最短的设备做根因分析
八、给 IE 学生的建议
- 先掌握 FMEA 的实操:这是最常用、最容易上手、也最容易写进简历的可靠性工具
- 理解指数分布与威布尔分布:会算 R(t)、MTBF、可用度,面试时是加分项
- 会画故障树:遇到复杂问题分析时,FTA 是结构化拆解的好工具
- 做一次完整的 PFMEA:哪怕是针对学校实验室的一个设备,做出来的表格就是作品
- 把可靠性思维带回日常:任何方案都问一句"它会怎么失效?失效了会怎样?怎么提前发现?"
小结
- 可靠性三指标:可靠度 R(t) = e^(-λt)(偶然失效期)、MTBF = 1/λ、可用度 A = MTBF/(MTBF+MTTR)。
- 浴盆曲线三段:早期失效(老化筛选)、偶然失效(λ 恒定)、耗损失效(预防性更换)。
- 串联系统单元越多可靠度越低(0.99¹⁰⁰ = 0.366),这既是"减少零件数"的依据,也是 DFA 的可靠性价值。
- FMEA 的三层链条:失效起因 → 失效模式 → 失效影响;打分 S/O/D,新版用 AP 替代 RPN,且 S ≥ 9 强制高优先级。
- 降风险优先级:改设计/工艺 > 防错 > 增加检验 > 培训。优化栏里全是"加强培训"说明没找到根因。
- FTA 是自上而下的补充工具,最小割集阶数越低风险越高,优先消除一阶割集。
配套阅读:《六西格玛 DMAIC 完整指南》《质量管理体系入门》《OEE 设备综合效率》。
相关阅读
- 标准工时怎么定?秒表测时 + 评比系数 + 宽放率的完整流程:从观测单元划分、观测次数确定、异常值剔除,到平准化评比与四类宽放,用完整算例讲透标准工时的全…
- MODAPTS 模特排时法入门:21 个动作与工时计算:产线还没建就能算出工时。本文系统讲解 MODAPTS 的 21 个基本动作、MOD 时间单位…
- 生产线平衡:从节拍、瓶颈到平衡率改善的完整方法:节拍怎么算、瓶颈怎么找、要素怎么重新分配。含一个从 80.5% 提升到 92.2% 的完整改…
- SMED 快速换模:把内部作业转化为外部作业的实操步骤:内部作业与外部作业分离是 SMED 的全部理论基础。本文用 120 分钟降到 9 分钟的完整…
- SPC 统计过程控制入门:控制图怎么读、Cp/Cpk 怎么算:受控不等于有能力。本文讲清两类变异原因、控制图选型与系数表、八大判异准则,以及 Cp/Cpk…