工业工程

工业工程

首页
专业认知
课程体系
方法与工具
软件技能
就业发展
考研深造
院校学科
行业洞察
文章
关于
登录 →
工业工程

工业工程

首页 专业认知 课程体系 方法与工具 软件技能 就业发展 考研深造 院校学科 行业洞察 文章 关于
登录
  1. 首页
  2. 方法与工具
  3. 可靠性工程与 FMEA/FTA:让问题在发生之前被解决

可靠性工程与 FMEA/FTA:让问题在发生之前被解决

0
  • 方法与工具
  • 发布于 2025-09-14
  • 7 次阅读
伴读书童
伴读书童
目录
当前文章没有目录

可靠性工程与 FMEA/FTA:让问题在发生之前被解决

质量管理解决"做出来的东西合不合格",可靠性工程解决"用一段时间之后还行不行"。而 FMEA 和 FTA 提供的则是另一件事:在产品还没造出来之前,就系统地把可能的失效想一遍。这是工程领域少有的"事前算赢"工具。

一、可靠性的基本语言

可靠度 R(t)

可靠度 = 产品在规定条件下、规定时间内,完成规定功能的概率。

R(t) = P(T > t)
T = 产品寿命(失效发生的时间)

失效率 λ(t) 与浴盆曲线

失效率:工作到时刻 t 尚未失效的产品,在接下来单位时间内发生失效的概率。

典型的失效率曲线呈"浴盆形"(Bathtub Curve),分三段:

失效率 λ(t)
  ↑
  │  早期失效型           偶然失效型              耗损失效型
  │ ╲                                          ╱
  │  ╲                                       ╱
  │   ╲___________________________________╱
  │    (DFR)         (CFR)        (IFR)
  └──────────────────────────────────────────→ 时间 t
     早期失效期      偶然失效期      耗损失效期
   ( infant     ( useful life )( wear-out )
     mortality )
阶段 英文 特点 对策
早期失效期 DFR(Decreasing Failure Rate) 失效率随时间下降 早期故障主要来自设计缺陷、制造缺陷、材料问题、装配错误。对策:老化筛选(Burn-in)、早期失效分析、供应商管控
偶然失效期 CFR(Constant Failure Rate) 失效率近似恒定 由随机应力引起。对策:冗余设计、降额设计、使用维护
耗损失效期 IFR(Increasing Failure Rate) 失效率随时间上升 磨损、疲劳、老化。对策:预防性维护(PM)、定期更换、状态监测

工程意义:

  • 出厂前做老化筛选,可以把早期失效"提前消耗掉",交到客户手上的产品处于偶然失效期
  • 对耗损失效型部件,在失效率明显上升之前更换(这是 TPM 计划保全的理论基础)

指数分布模型(偶然失效期)

偶然失效期假设失效率恒定 λ:

可靠度    R(t) = e^(-λt)
失效概率  F(t) = 1 - e^(-λt)
失效率密度 f(t) = λ·e^(-λt)

平均无故障时间 MTBF = 1/λ = ∫₀^∞ R(t)dt

可靠寿命(给定可靠度 R 求时间):t_R = -ln(R) / λ

算例:某设备 MTBF = 500 小时,求工作 100 小时后的可靠度。

λ = 1/500 = 0.002 /小时
R(100) = e^(-0.002 × 100) = e^(-0.2) = 0.8187

即工作 100 小时后,约 81.9% 的设备仍能正常工作。

若要求可靠度 ≥ 95%,可工作多久?

t = -ln(0.95) / 0.002 = 0.0513 / 0.002 = 25.6 小时

这就是"可靠寿命"——它是制定维护周期的依据。

常用寿命分布

分布 适用 特点
指数分布 偶然失效期、电子元器件 无记忆性,λ 恒定
威布尔分布 Weibull 最通用 形状参数 β 决定失效率趋势:β<1 早期失效,β=1 偶然,β>1 耗损
正态分布 耗损失效、机械磨损 对称分布
对数正态分布 疲劳、腐蚀 右偏

威布尔分布是可靠性工程的主力工具:

R(t) = exp[ -(t/η)^β ]
β = 形状参数(shape)
η = 尺度参数 / 特征寿命(R(η) = e^(-1) = 36.8%)

二、系统可靠度模型

串联系统

任一单元失效,系统失效。

R_s = R₁ × R₂ × ... × R_n
(指数分布、失效率恒定:λ_s = Σλ_i,MTBF_s = 1/Σλ_i)

关键洞察:串联系统里,单元越多,系统可靠度越低。

例:10 个单元串联,每个可靠度 0.99 → 系统 R = 0.99¹⁰ = 0.904 100 个单元串联,每个 0.99 → R = 0.99¹⁰⁰ = 0.366

这就是"减少零件数量"的可靠性依据——DFA(面向装配的设计)不仅降成本,还直接提升可靠性。

并联系统(冗余)

全部单元失效,系统才失效。

R_s = 1 - (1-R₁)(1-R₂)...(1-R_n)

两单元并联:R_s = 1 - (1-R)² = 2R - R²
若 R = 0.9 → R_s = 1 - 0.01 = 0.99

冗余是提升可靠度最直接的手段,代价是成本、重量、体积增加。

表决系统(k/n 系统)

n 个单元中至少 k 个正常,系统才正常。

R_s = Σ(i=k 到 n) C(n,i) · R^i · (1-R)^(n-i)

例:3 取 2 系统(n=3, k=2),R = 0.9:

R_s = C(3,2)·0.9²·0.1 + C(3,3)·0.9³
    = 3 × 0.81 × 0.1 + 1 × 0.729
    = 0.243 + 0.729 = 0.972

三、可用度(Availability)

可靠度关注"能撑多久",可用度关注"能用多久 / 总时间"。

固有可用度 A_i = MTBF / (MTBF + MTTR)
使用可用度 A_o = MTBF / (MTBF + MDT)
MDT = 平均停机时间 = MTTR + 平均后勤延误 + 平均管理延误
  • MTBF:平均故障间隔时间(Mean Time Between Failures)
  • MTTR:平均修复时间(Mean Time To Repair)

提高可用度的两条路:

  1. 提高 MTBF(少坏):改善设计、预防保全、可靠性增长
  2. 缩短 MTTR(快修):备件管理、维修标准化、模块化设计、快速诊断、远程运维

实务提醒:很多企业只盯着 MTBF,忽视了 MTTR。但缩短 MTTR 往往投入更小、见效更快——模块化设计 + 备件前置 + 维修手册标准化即可。

可靠性指标速查

指标 英文 公式
平均无故障时间 MTBF 总运行时间 / 故障次数
平均修复时间 MTTR 总修复时间 / 故障次数
平均首次故障时间 MTTFF 不可修复产品
平均故障前时间 MTTF 与 MTBF 常用于不同语境
可用度 A MTBF / (MTBF + MTTR)
失效率 λ 1 / MTBF
可靠度 R(t) e^(-λt)(指数分布)

四、FMEA:失效模式与影响分析

定义与发展

FMEA(Failure Mode and Effects Analysis):系统地识别产品或过程中潜在的失效模式、评估其影响与原因、量化风险并制定措施的分析方法。

起源:1940 年代美国军方,1960 年代 NASA 用于阿波罗计划,后被汽车行业(QS-9000 → IATF 16949)推广。

新版变化:AIAG-VDA FMEA(2019)用 AP(Action Priority,行动优先级) 替代传统 RPN。

两类 FMEA

DFMEA PFMEA
对象 产品设计 制造/装配过程
分析什么 零件/子系统的功能与失效 工序的作业与失效
何时做 设计阶段(越早越好) 过程设计阶段,量产前完成
责任人 设计工程师 工艺/制造/IE 工程师
输出 影响设计变更、特殊特性 影响控制计划、防错、SOP

FMEA 的"七步法"(AIAG-VDA)

步骤 内容
1. 策划与准备 定义范围(5T:InTent 意图、Timing 时机、Team 团队、Task 任务、Tool 工具)
2. 结构分析 画出结构树 / 过程流程图,拆解到最小单元
3. 功能分析 描述每个单元的功能与要求(用"动词 + 名词 + 可测量指标")
4. 失效分析 识别:失效影响(FE)→ 失效模式(FM)→ 失效起因(FC)
5. 风险分析 打分 S / O / D,确定AP(行动优先级)
6. 优化 制定降低风险的措施,重新评估
7. 结果文件化 输出 FMEA 表与结论

失效的三层链条(关键)

失效起因 FC(Cause)
    ↓ 导致
失效模式 FM(Mode)        ← 失效的具体表现形式
    ↓ 导致
失效影响 FE(Effect)      ← 对客户/下工序/系统的影响

举例(PFMEA):

层级 内容
失效起因 扭矩枪设定的扭矩值错误
失效模式 螺栓拧紧扭矩低于规范(< 8.0 N·m)
失效影响 装配松动 → 异响 → 客户投诉;严重情况下螺栓脱落

打分标准(AIAG-VDA 简化版)

严重度 S(Severity,1~10):失效影响的严重程度

S 描述
9~10 影响安全/法规符合性,无警告 / 非常高
7~8 功能丧失/严重降级,客户非常不满
4~6 功能降级,客户不满
2~3 轻微影响,部分客户察觉
1 无可察觉影响

发生度 O(Occurrence,1~10):失效起因发生的可能性

O 描述
8~10 很高(几乎不可避免,历史频繁发生)
6~7 中高(同类过程经常发生)
4~5 中等(偶尔发生)
2~3 低(很少发生)
1 极低(通过防错已消除)

探测度 D(Detection,1~10):在流出前被发现的能力

D 描述
8~10 无法探测 / 没有控制手段
6~7 探测可能性低
4~5 中等(抽样检验)
2~3 高(自动检测、防错装置)
1 几乎必然探测(防错,错误不可能发生)

RPN 与 AP

传统 RPN:

RPN = S × O × D    范围 1 ~ 1000

常见做法:RPN > 100 需采取措施;S ≥ 8 无论 RPN 都要处理。

RPN 的问题:

  • 三个因子权重相同,但现实中严重度更重要
  • 不同组合可能得到相同 RPN(S=10,O=1,D=10 与 S=1,O=10,D=10 都是 100,风险性质完全不同)
  • 容易导致"刷分"而不是真改善

新版 AP(Action Priority):通过查表确定 H(高)/ M(中)/ L(低)优先级,且严重度 9~10 强制为高优先级。

行动优先级 含义
H(高) 必须采取措施降低风险
M(中) 应当采取措施
L(低) 可以采取措施(也可接受)

降低风险的优先级

优先级 措施类型 效果
1(最优) 消除失效起因(修改设计/工艺) 降低 O
2 防错(让失效不可能发生或立即检出) 降低 O 或 D
3 增加探测手段(自动检测、100% 检验) 降低 D
4(最弱) 增加警示、培训、SOP 效果有限

关键洞察:只有"修改设计/工艺"和"防错"能真正降低风险,增加检验和培训是最弱的手段。 很多组织的 FMEA 优化栏里填满了"加强培训""加强检验",这实际上是承认没有找到真正的对策。

一个简化 PFMEA 行示例

工序 功能要求 失效模式 失效影响 S 失效起因 O 现行控制 D RPN AP 建议措施
锁付 扭矩 8.0±0.5 N·m 扭矩不足 松动异响 7 扭矩枪参数设定错误 4 每 2h 抽检 5 件 5 140 H 改用带参数锁定的数显扭矩枪 + 计数防错

采取措施后重新评估:O 从 4 → 2,D 从 5 → 2,RPN = 7×2×2 = 28。

FMEA 的常见失败

  1. 一个人关起门来填:必须跨部门团队(设计、工艺、制造、质量、维修、供应商)
  2. 做一次就束之高阁:FMEA 是活文件,客户投诉、内外部失效、工艺变更都要触发更新
  3. 罗列所有失效但都是低分:说明没分析到真正的风险点
  4. 优化措施全是"加强培训":说明没找到根因
  5. 与现场脱节:FMEA 说有 20 个高风险,现场实际发生的问题却不在表里——说明分析失效

五、FTA:故障树分析

与 FMEA 的对比

FMEA FTA
方向 自下而上(Bottom-up):从零件失效推到系统影响 自上而下(Top-down):从不希望发生的顶事件往下找原因
起点 每个组件的每个失效模式 一个特定的顶事件(如"刹车失效")
擅长 穷举所有可能的失效 深入分析某个特定失效的所有路径
输出 风险清单 逻辑图 + 最小割集

实务用法:FMEA 用于全面排查,FTA 用于对高风险/安全事故的深入根因分析。

FTA 的符号

符号 名称 含义
与门 AND 所有输入事件同时发生,输出才发生 并联(冗余)结构的失效
或门 OR 任一输入事件发生,输出就发生 串联结构的失效
基本事件 不能再分解的底事件 元件失效等
未展开事件 信息不足暂不展开

定性分析:最小割集

割集:导致顶事件发生的基本事件集合。 最小割集:去掉任何一个事件就不再构成割集。

例:某系统 T = A 或 (B 且 C)

最小割集 = {A}, {B, C}
  • 一阶割集 {A}:单个事件就能导致顶事件 → 高风险,优先消除
  • 二阶割集 {B,C}:两个事件同时发生才导致 → 风险较低

分析结论:最小割集阶数越低、数量越多,系统越不可靠。优先消除一阶割集。

定量计算

或门(串联失效):

P(T) = 1 - Π(1 - P_i)
若概率很小,近似:P(T) ≈ ΣP_i

与门(并联失效):

P(T) = Π P_i

算例:某安全系统 T = A 或 (B 且 C),P(A)=0.01,P(B)=0.02,P(C)=0.03

P(B且C) = 0.02 × 0.03 = 0.0006
P(T) = 1 - (1-0.01)(1-0.0006) = 1 - 0.99 × 0.9994 = 1 - 0.989406 = 0.0106

六、可靠性试验与增长

常见可靠性试验

类型 目的
环境试验 高低温、湿热、盐雾、振动、冲击
寿命试验 在加速应力下测寿命,外推正常使用条件
加速寿命试验 ALT 加大应力(温度、电压、振动)加速失效,用模型外推
老化筛选 Burn-in 出厂前运行一段时间,剔除早期失效
可靠性增长试验 试验—分析—改进(TAAF)循环

加速模型举例(阿伦尼乌斯模型,温度加速):

加速因子 AF = exp[ (Ea/k) × (1/T_use - 1/T_stress) ]
Ea = 激活能(eV),k = 玻尔兹曼常数 8.617×10⁻⁵ eV/K
T 为绝对温度(K)

TAAF 循环

试验 Test → 分析 Analyze → 改进 Fix → 再试验

这是可靠性增长的基本机制,每一次循环把 MTBF 抬高一档。

七、维修性设计与 TPM 的连接

维修性(Maintainability)指标

  • MTTR:平均修复时间
  • 维修度 M(t):在规定条件下、规定时间内完成维修的概率
  • 最大修复时间:如 95% 的维修在 X 分钟内完成

提升维修性的设计原则

  1. 模块化:故障模块整体更换,现场不修
  2. 可达性:易损件放在容易够到的位置(这是人因 + 可靠性的交叉点)
  3. 标准化:减少工具种类、统一紧固件
  4. 故障诊断能力:内置自检(BIT)、故障代码
  5. 防错装配:拆也只能按一种方式装回去
  6. 标识清晰:接线、管路有编号

与 TPM 的关系:

  • 自主保全:操作工做点检、清洁、润滑、紧固——防止"强制劣化"
  • 计划保全:基于 MTBF 与耗损失效规律制定维护周期,在失效率上升前更换
  • 个别改善:针对 MTBF 最短的设备做根因分析

八、给 IE 学生的建议

  1. 先掌握 FMEA 的实操:这是最常用、最容易上手、也最容易写进简历的可靠性工具
  2. 理解指数分布与威布尔分布:会算 R(t)、MTBF、可用度,面试时是加分项
  3. 会画故障树:遇到复杂问题分析时,FTA 是结构化拆解的好工具
  4. 做一次完整的 PFMEA:哪怕是针对学校实验室的一个设备,做出来的表格就是作品
  5. 把可靠性思维带回日常:任何方案都问一句"它会怎么失效?失效了会怎样?怎么提前发现?"

小结

  • 可靠性三指标:可靠度 R(t) = e^(-λt)(偶然失效期)、MTBF = 1/λ、可用度 A = MTBF/(MTBF+MTTR)。
  • 浴盆曲线三段:早期失效(老化筛选)、偶然失效(λ 恒定)、耗损失效(预防性更换)。
  • 串联系统单元越多可靠度越低(0.99¹⁰⁰ = 0.366),这既是"减少零件数"的依据,也是 DFA 的可靠性价值。
  • FMEA 的三层链条:失效起因 → 失效模式 → 失效影响;打分 S/O/D,新版用 AP 替代 RPN,且 S ≥ 9 强制高优先级。
  • 降风险优先级:改设计/工艺 > 防错 > 增加检验 > 培训。优化栏里全是"加强培训"说明没找到根因。
  • FTA 是自上而下的补充工具,最小割集阶数越低风险越高,优先消除一阶割集。

配套阅读:《六西格玛 DMAIC 完整指南》《质量管理体系入门》《OEE 设备综合效率》。

相关阅读

  • 标准工时怎么定?秒表测时 + 评比系数 + 宽放率的完整流程:从观测单元划分、观测次数确定、异常值剔除,到平准化评比与四类宽放,用完整算例讲透标准工时的全…
  • MODAPTS 模特排时法入门:21 个动作与工时计算:产线还没建就能算出工时。本文系统讲解 MODAPTS 的 21 个基本动作、MOD 时间单位…
  • 生产线平衡:从节拍、瓶颈到平衡率改善的完整方法:节拍怎么算、瓶颈怎么找、要素怎么重新分配。含一个从 80.5% 提升到 92.2% 的完整改…
  • SMED 快速换模:把内部作业转化为外部作业的实操步骤:内部作业与外部作业分离是 SMED 的全部理论基础。本文用 120 分钟降到 9 分钟的完整…
  • SPC 统计过程控制入门:控制图怎么读、Cp/Cpk 怎么算:受控不等于有能力。本文讲清两类变异原因、控制图选型与系数表、八大判异准则,以及 Cp/Cpk…
相关文章
GB/T 工时标准完全指南:用国标体系建立可信的标准工时

GB/T 工时标准完全指南:用国标体系建立可信的标准工时

标准工时不是掐秒表掐出来的数,而是有国标依据的科学测定结果。本文讲清 GB/T 工时标准体系、标准工时四要素、宽放率与评定系数的取法、四种测定方法对比,以及企业如何搭建可信的工时标准库。

MES 落地方法论完全指南:从选型到上线,避开 80% 项目踩的坑

MES 落地方法论完全指南:从选型到上线,避开 80% 项目踩的坑

MES 不是买套软件装上就行,70% 的项目失败在落地。本文讲清 MES 的 11 个功能模块、与 ERP/SCADA 的层级关系、六步实施法、数据采集策略、IE 在其中的角色,以及最常见的五大失败根因。

仿真方法论完全指南:用数字孪生前的第一步把产线跑明白

仿真方法论完全指南:用数字孪生前的第一步把产线跑明白

仿真不是画动画,而是用统计实验回答'如果这样改,会怎样'。本文讲清离散事件仿真原理、建模七步与 V&V 验证、随机分布与输出分析、主流软件对比,以及在产线/仓储中的落地套路。

产能规划完全指南:算清产线到底能产多少、该扩多少

产能规划完全指南:算清产线到底能产多少、该扩多少

产能不是设备铭牌上的数,而是扣除了停机、换型、良率后的真实产出。本文讲清设计/有效/实际三种产能、产能计算、扩展策略(领先/滞后/同步)、季节性调节手段,并给出产能规划的完整步骤与指标。

价值工程(VE)完全指南:用功能分析把成本砍半而不降质

价值工程(VE)完全指南:用功能分析把成本砍半而不降质

价值工程不是一味压价,而是追问'这个功能值不值这个钱'。本文讲清价值公式 V=F/C、功能评价三种方法、VE 七步工作程序与 FAST 图,并用零件简化案例展示如何降本 40% 而不减性能。

物料搬运分析完全指南:把看不见的搬运浪费挖出来

物料搬运分析完全指南:把看不见的搬运浪费挖出来

搬运不直接增值,却常占工厂成本的 20%—50%。本文系统讲清搬运活性理论、20 条搬运原则、SHA 系统分析法、设备选型与布局协同,并给出可落地的改善路径。

目录
当前文章没有目录
Copyright © 2002 CUMT All Rights Reserved. Powered by 中国矿业大学工业工程系.
粤ICP备2024349181号-3