工业工程数据与指标看板:从指标定义、采集口径到可视化落地的完整手册
大多数工厂的看板是"假看板"——屏幕上数字很漂亮,但没人知道它怎么算的、该不该信、超限时该找谁。这篇从指标定义卡的 12 个要素讲起,给出六个统计口径的纠偏方法、八个核心指标的手算算例、采集方案的选型对照与看板设计规则,最后附 40 项检查清单。
一、先诊断:为什么你的看板没人看
工业工程做数据看板,最常见的失败不是技术失败,而是信任失败。以下三类失败几乎覆盖了 90% 的情况。
1.1 失败类型一:口径不清,数字打架
典型场景:早会上产量看板显示 12,480 件,MES 系统显示 12,310 件,ERP 显示 12,655 件。争论半小时,最后谁的数字都不信,改用"大概一万二"来决策。
根因:三个系统的分母定义不同。
| 系统 | 计数时点 | 是否含返工件 | 是否含试产件 | 是否含报废件 |
|---|---|---|---|---|
| 看板 | 下线扫码 | 含(重复计) | 含 | 不含 |
| MES | 工序报工 | 不含 | 含 | 不含 |
| ERP | 入库过账 | 不含 | 不含 | 不含 |
三个数字都对,也对不上。 解决办法不是"统一到一个系统",而是在指标定义卡里把口径写死,并让所有系统按同一口径取数。
1.2 失败类型二:只报不改,看板变成装饰
典型场景:看板天天显示 OEE 72%,红色告警每周都亮,但三个月过去了没人动。
根因:指标没有责任人和行动规则。 一个能驱动行动的指标必须回答三个问题:
- 谁对这个数字负责?(到具体岗位,不是"生产部")
- 超限时做什么?(预设的动作清单,不是"分析原因"这种废话)
- 多久内必须响应?(分钟级/小时级/日级)
看板三问(本文会反复用到):谁看?看什么?看完做什么? 回答不了这三问的指标,不配占用屏幕空间。
1.3 失败类型三:指标被"游戏化"
典型场景:某厂把"设备利用率"纳入车间月度考核。三个月后,利用率从 68% 涨到 89%,但 WIP 翻了一倍、交期延误率上升、在制资金占用超标。
根因:单指标考核必然被博弈。 这是古德哈特定律的标准案例:当一个指标成为目标,它就不再是好指标。
对策在本篇第七章展开(指标组合、对冲指标、过程+结果双轨)。
二、指标体系设计:从战略到工位的四层结构
2.1 指标金字塔
| 层级 | 服务对象 | 更新频率 | 典型指标 | 指标数量 |
|---|---|---|---|---|
| L1 战略层 | 厂长/总经理 | 月/季 | 单位制造成本、OEE 趋势、OTIF、库存周转、人均产值 | 5~8 个 |
| L2 部门层 | 部门经理 | 周/月 | 计划达成率、良率、设备可动率、人员效率、在制水平 | 10~15 个 |
| L3 产线层 | 车间主任/班组长 | 日/班 | 班次 OEE、产量达成、停机 TOP3、FPY、节拍达成 | 8~12 个 |
| L4 工位层 | 操作工/检验员 | 实时/小时 | 实际节拍 vs 目标节拍、不良数、安灯响应、换型计时 | 3~5 个 |
设计原则:
- 上层指标必须能被下层指标解释。 如果 L1 的"单位制造成本"上升,必须能通过 L2/L3 的指标追溯到具体原因(是良率降了?还是停机多了?还是人员效率低了?)。
- 每一层只保留能驱动行动的指标。 L4 工位层超过 5 个指标,操作工就一个都不会看。
- 上下层之间用"指标树"连接,不要用"拍脑袋的比例分摊"。
2.2 指标定义卡:12 个必填要素
这是本文最实用的一张表。任何一个要上墙的指标,都必须先填完这张卡。 我见过太多项目因为跳过这一步,在上线后推倒重来。
| # | 要素 | 说明 | 示例(OEE) |
|---|---|---|---|
| 1 | 指标名称 | 唯一且无歧义 | 设备综合效率 OEE |
| 2 | 业务定义 | 用一句话说清它度量什么 | 设备实际创造合格产品的时间占计划负荷时间的比例 |
| 3 | 计算公式 | 可复现的算式 | OEE = 可用率 × 性能效率 × 合格品率 |
| 4 | 分子定义 | 含什么、不含什么 | 合格品数 × 理论节拍(单件标准时间) |
| 5 | 分母定义 | 关键,最易出错 | 负荷时间 = 日历时间 − 计划停机(休息、交接班、计划保养) |
| 6 | 数据来源 | 系统 + 字段 + 取数接口 | MES 设备状态表 equip_status;SCADA 脉冲计数 |
| 7 | 采集方式 | 自动/半自动/人工 | 设备状态自动采集;人工填报停机原因代码 |
| 8 | 统计频率 | 计算与刷新周期 | 每班计算一次,日/周/月滚动汇总 |
| 9 | 聚合规则 | 多设备/多线如何合并 | 按负荷时间加权,禁止算术平均(见 3.2 节) |
| 10 | 目标值与阈值 | 目标 / 预警 / 报警 | 目标 85%;预警 < 75%;报警 < 65% |
| 11 | 责任人 | 到岗位,不到部门 | 设备工程师(可用率)/工艺工程师(性能)/质量工程师(合格品率) |
| 12 | 行动规则 | 超限时的标准动作清单 | 报警触发→2 h 内召开停机分析会→输出 TOP3 停机原因→48 h 内对策 |
特别强调第 9 条(聚合规则)和第 12 条(行动规则)。 前者决定数字对不对,后者决定看板有没有用。
2.3 指标树:让上层指标可追溯
指标树的作用是建立"结果指标 → 过程指标"的因果链。以 OEE 为例:
OEE
┌───────────────┼───────────────┐
可用率 性能效率 合格品率
│ │ │
┌────┴────┐ ┌────┴────┐ ┌────┴────┐
换型 故障 空转 速度 返修 报废
停机 停机 待料 损失 品 品
│ │ │ │ │ │
SMED PM/备件 物料配送 参数优化 工艺 工艺
项目 管理 节拍化 与维护 能力 能力
算例 2-1:用指标树分配改善资源
某产线某月 OEE = 71.6%,负荷时间 8,000 min。反推损失时间构成:
| 损失类别 | 损失时间(min) | 占负荷时间 | 对 OEE 的影响 | 归口 |
|---|---|---|---|---|
| 换型停机 | 480 | 6.0% | −6.0 pp | IE(SMED) |
| 故障停机 | 420 | 5.25% | −5.25 pp | 设备 |
| 待料/等待 | 260 | 3.25% | −3.25 pp | 物流/计划 |
| 空转与短停 | 340 | 4.25% | −4.25 pp | 设备/工艺 |
| 速度损失 | 300 | 3.75% | −3.75 pp | 工艺 |
| 返修与报废 | 400 | 5.0% | −5.0 pp | 质量/工艺 |
| 合计损失 | 2,200 | 27.5% | OEE = 72.5% | — |
(校验:1 − 0.275 = 0.725,与实测 71.6% 的差异来自四舍五入与未归类损失,实务中应保留"其他"项做平账)
改善资源分配的正确逻辑:
- 不是按损失大小排序,而是按「可改善空间 × 改善难度」排序。 故障停机 5.25 pp 看着不小,但如果该设备是进口专用设备、备件交期 12 周,短期几乎无法改善。
- 优先做"低垂的果实": 换型停机 6.0 pp 通常通过 SMED 能压缩 40%~60%(具体效果因场景而异),且不需要资本开支 → 优先投入。
- 每次只追 2~3 个损失项。 同时追 6 项的结果是每项都做了 20%。
建议的季度节奏: 选 2 个损失项 → 集中资源做深 → 固化标准 → 下季度选新的 2 项。
三、六个必须讲清楚的统计口径
这一章是全篇最容易"看起来懂了但实际还在犯错"的部分。每一节都给一个对照算例。
3.1 均值 vs 分位数:长尾会骗人
算例 3-1:交付提前期的均值陷阱
15 个订单的实际交付提前期(天,已排序):
3, 4, 4, 5, 5, 5, 6, 6, 7, 8, 9, 12, 15, 18, 25
计算:
- 总和 = 132 → 均值 = 132 / 15 = 8.8 天
- 中位数 P50 = 第 8 个 = 6 天
- P90 位置 = 0.9 × (15 − 1) + 1 = 13.6 → x₁₃ = 15,x₁₄ = 18 → P90 = 15 + 0.6 × 3 = 16.8 天
- P95 位置 = 0.95 × 14 + 1 = 14.3 → x₁₄ = 18,x₁₅ = 25 → P95 = 18 + 0.3 × 7 = 20.1 天
- 承诺 10 天交付 → 达标率 = 11 / 15 = 73.3%
管理层看到均值 8.8 天会认为"我们承诺 10 天,没问题"。实际上 26.7% 的客户被延误,P90 客户等了 16.8 天。
规则:
| 指标性质 | 应使用 | 禁用 |
|---|---|---|
| 时间类(周期时间、TAT、等待、响应) | P50 + P90 + 达标率 | 均值(作为唯一指标) |
| 成本类、总量类 | 均值/合计 | — |
| 质量特性(尺寸、重量、性能) | 均值 + 标准差 + Cpk | 均值(作为唯一指标) |
| 通过率/达成率 | 加权值(见 3.2) | 算术平均 |
3.2 加权 vs 算术:多线合并时必然踩的坑
算例 3-2:三条产线的 OEE 汇总
| 产线 | 负荷时间(min) | OEE | 合格产出时间(min) |
|---|---|---|---|
| A | 450 | 75.44% | 339.5 |
| B | 900(两班) | 62.00% | 558.0 |
| C | 450 | 81.00% | 364.5 |
| 合计 | 1,800 | — | 1,262.0 |
错误算法(算术平均):
(75.44% + 62.00% + 81.00%) / 3 = 72.81%
正确算法(按负荷时间加权):
加权 OEE = (339.5 + 558.0 + 364.5) / 1,800 = 1,262.0 / 1,800 = 70.11%
差异 2.70 个百分点。 为什么会错?因为 B 线开两班、负荷时间是其他线的两倍,它的低效应该占更大权重。算术平均把三条线当成同等重要,等于假设每条线的产能相同,这在现实中几乎从不成立。
同理适用于:
- 良率:多工序/多产品的合并良率应按投入量加权,而不是各良率的算术平均
- 达成率:应按计划量加权
- 单价、成本:应按数量加权
但有一个例外:当各单元权重相等时,两者相同。 上例中若三条线负荷时间都是 450 min,加权 = 算术 = 72.81%。所以问题不在于方法,而在于你是否检查过权重。
3.3 移动平均 vs 累计:趋势与现状是两件事
| 口径 | 算法 | 用途 | 陷阱 |
|---|---|---|---|
| 日/班值 | 单期实际值 | 现场日报、异常响应 | 波动大,容易被单日异常干扰 |
| 移动平均(MA) | 最近 n 期均值,如 MA7 | 看趋势、过滤噪声 | 滞后(滞后约 n/2 期) |
| 累计值(YTD/MTD) | 期初至今累计 | 考核、对账 | 会被早期数据稀释,掩盖近期恶化 |
典型误用: 用"年度累计 OEE 78%"汇报,而最近三个月已经跌到 68%。累计值的滞后性会掩盖拐点。
推荐组合: 主图用 MA7 趋势线 + 单期值散点,副图用 累计值(仅对账用)。
3.4 分母定义:OEE 的三个分母
这是 OEE 领域最经典的争议。三种分母对应三种用途:
| 分母口径 | 定义 | 数值(同一组数据) | 用途 |
|---|---|---|---|
| 日历时间 | 24 h × 天数 | 480 min/班 | 衡量资产总利用,适合投资决策 |
| 计划工作时间 | 日历 − 非排产时间(周末、无订单) | 480 min | 衡量排产合理性 |
| 负荷时间 | 计划工作时间 − 计划停机(休息、交接、计划保养) | 450 min | 标准 OEE 定义,适合现场改善 |
算例 3-3:同一组数据,三种口径的三个 OEE
基础数据:单班 8 h = 480 min;计划停机 30 min(休息 20 + 交接 10);非计划停机 45 min;理论节拍 30 s/件;实际产出 700 件,其中合格 679 件。
口径 A(分母 = 负荷时间 450 min,标准 OEE):
- 运行时间 = 450 − 45 = 405 min
- 可用率 = 405 / 450 = 90.00%
- 理论产出 = 405 × 60 / 30 = 810 件
- 性能效率 = 700 / 810 = 86.42%
- 合格品率 = 679 / 700 = 97.00%
- OEE = 0.9000 × 0.8642 × 0.9700 = 0.7545 → 75.45%
口径 B(分母 = 计划工作时间 480 min):
- 运行时间 = 480 − 30 − 45 = 405 min(同样)
- 可用率 = 405 / 480 = 84.38%
- OEE = 0.8438 × 0.8642 × 0.9700 = 0.7074 → 70.74%
口径 C(分母 = 日历时间 480 min,且假设全天排产):
同口径 B(若只排一班且日历口径按 24 h 计,则可用率 = 405/1440 = 28.13%,OEE ≈ 23.58%)
结论:同一个现场,OEE 可以是 75.45% 或 70.74% 或 23.58%,全都"正确"。
IE 的实务建议:
- 对外对标/内部横向比较:用口径 A(负荷时间),这是业界最通用的定义
- 做投资决策(要不要加设备):用口径 C,因为它反映了资产的真实利用水平
- 无论如何,必须在指标定义卡里写明口径,并永远不混用
3.5 时间粒度对齐:班次、日、周
常见问题:日看板显示"日产量达成 102%",但月度达成只有 94%。为什么?
典型原因:
- 班次之间的归属问题:夜班跨零点,22:00 开始的班次产量算哪一天?必须有明确规则(通常按班次开始日归属)。
- 周末与工作日的混合:月度达成率的分母应包含所有排产日,不能只算工作日。
- 月末截断:最后一天只跑了半个班,却被按整天比较。
规则:所有比率类指标,分子分母必须来自同一时间窗口、同一口径的排产集合。
3.6 异常值处理:规则必须先定,不能事后挑
算例 3-4:三种剔除规则的差异
某工序 12 次测时值(秒):
34.2, 35.1, 36.8, 34.9, 35.5, 72.4, 35.8, 34.6, 35.2, 36.1, 35.9, 34.8
规则一(不剔除):均值 = ?
34.2+35.1=69.3; +36.8=106.1; +34.9=141.0; +35.5=176.5; +72.4=248.9; +35.8=284.7; +34.6=319.3; +35.2=354.5; +36.1=390.6; +35.9=426.5; +34.8=461.3 均值 = 461.3 / 12 = 38.44 s
规则二(3σ 剔除):
- 均值 38.44,标准差:偏差平方和 72.4 的偏差 = 33.96 → 平方 1153.3 其余值围绕 35.4 左右。先算:不含 72.4 的 11 个值均值 = (461.3−72.4)/11 = 388.9/11 = 35.35 但 3σ 要用全样本算: 各值偏差(相对 38.44):−4.24, −3.34, −1.64, −3.54, −2.94, +33.96, −2.64, −3.84, −3.24, −2.34, −2.54, −3.64 平方:17.98, 11.16, 2.69, 12.53, 8.64, 1153.28, 6.97, 14.75, 10.50, 5.48, 6.45, 13.25 和 = 1263.68;样本方差 = 1263.68/11 = 114.88;s = 10.72 s
- 3σ 界 = 38.44 ± 32.16 = [6.28, 70.60]
- 72.4 > 70.60 → 剔除
- 剔除后 11 个值均值 = 388.9 / 11 = 35.35 s
规则三(IQR 剔除):
- 排序:34.2, 34.6, 34.8, 34.9, 35.1, 35.2, 35.5, 35.8, 35.9, 36.1, 36.8, 72.4
- n = 12 → Q1 位置 = 0.25 × 11 + 1 = 3.75 → x₃ + 0.75(x₄ − x₃) = 34.8 + 0.75 × 0.1 = 34.875
- Q3 位置 = 0.75 × 11 + 1 = 9.25 → x₉ + 0.25(x₁₀ − x₉) = 35.9 + 0.25 × 0.2 = 35.95
- IQR = 35.95 − 34.875 = 1.075
- 上界 = Q3 + 1.5 × IQR = 35.95 + 1.6125 = 37.56
- 72.4 > 37.56 → 剔除(同时检查下界 = 34.875 − 1.6125 = 33.26,无低值被剔除)
- 剔除后均值 = 35.35 s
三种规则对比:
| 规则 | 剔除结果 | 均值 | 特点 |
|---|---|---|---|
| 不剔除 | — | 38.44 s | 被单点污染,高估 8.7% |
| 3σ | 剔除 72.4 | 35.35 s | 需样本量足够;单个极端值会把 s 拉大,导致剔除不干净("掩蔽效应") |
| IQR | 剔除 72.4 | 35.35 s | 稳健,不受极端值影响,小样本更可靠 |
这个算例里 3σ 侥幸成功,但如果 72.4 变成 60,3σ 就可能剔除不掉(因为 s 会被它自己拉大)。 这就是为什么工时测量推荐用 IQR 或"三倍中位绝对偏差(MAD)"这类稳健统计量。
规则必须事前写在指标定义卡里,而且剔除记录要留痕。 事后挑数据删,是数据造假的第一步。
四、八个核心指标的公式与手算算例
4.1 OEE 及其三因子
公式与算例见 3.4 节算例 3-3(OEE = 75.45%)。这里补充三因子的解释:
| 因子 | 公式 | 本例 | 含义 | 常见改善手段 |
|---|---|---|---|---|
| 可用率 A | 运行时间 / 负荷时间 | 90.00% | 设备有没有在跑 | SMED、TPM、备件管理 |
| 性能效率 P | 实际产出 / 理论产出 | 86.42% | 跑得够不够快 | 参数优化、短停消除、操作标准化 |
| 合格品率 Q | 合格数 / 产出数 | 97.00% | 跑出来的好不好 | 工艺能力、防错、首件确认 |
牢记:OEE 是三个独立问题的乘积,不是一个"设备好不好"的总分。 一个 OEE 75% 可能来自 A=95%、P=98%、Q=81%(质量问题是主因),也可能来自 A=80%、P=94%、Q=99%(停机是主因)——对策完全不同。
4.2 加权 OEE
见算例 3-2(70.11% vs 算术平均 72.81%)。
4.3 OTIF(准时足额交付率)
算例 4-1:100 个订单行的交付表现
| 组合 | 行数 | 占比 |
|---|---|---|
| 准时 + 足额(OTIF) | 86 | 86% |
| 准时 + 短少 | 7 | 7% |
| 延误 + 足额 | 4 | 4% |
| 延误 + 短少 | 3 | 3% |
| 合计 | 100 | 100% |
三个指标:
- OTD(On Time Delivery,准时率)= (86 + 7) / 100 = 93%
- OF(Order Fill,足额率)= (86 + 4) / 100 = 90%
- OTIF(准时且足额)= 86 / 100 = 86%
为什么必须看 OTIF 而不是 OTD? 因为对客户来说,"准时到了但少了一半"和"没到"一样麻烦——生产线照样停。OTD 93% 看起来很好,但只有 86% 的客户真正满意。这两个数字相差的 7 个百分点,就是你的客户不满意但你的报表却说没问题的部分。
4.4 RTY(流通合格率)与 DPMO
算例 4-2:五工序串联的合格率
各工序一次通过率(FPY):0.96, 0.93, 0.98, 0.95, 0.97
RTY(Rolled Throughput Yield)= 各工序 FPY 连乘:
- 0.96 × 0.93 = 0.8928
- × 0.98 = 0.874944
- × 0.95 = 0.831197
- × 0.97 = 0.806261 → 80.63%
错误算法(各工序算术平均):
(0.96 + 0.93 + 0.98 + 0.95 + 0.97) / 5 = 4.79 / 5 = 95.80%
两者相差 15.17 个百分点! 这是制造业最经典的指标失真之一:"我们的合格率是 95.8%"这句话,几乎可以肯定是错的。
DPMO 与西格玛水平:
投入 1,000 件,逐工序追踪:
| 工序 | 投入 | 合格产出 | 缺陷数 |
|---|---|---|---|
| 1 | 1,000 | 960.0 | 40.00 |
| 2 | 960.0 | 892.8 | 67.20 |
| 3 | 892.8 | 874.9 | 17.86 |
| 4 | 874.9 | 831.2 | 43.75 |
| 5 | 831.2 | 806.3 | 24.94 |
| 合计 | — | 806.3 | 193.75 |
- 总缺陷数 = 193.75
- 总机会数 = 1,000 × 5 = 5,000
- DPMO = 193.75 / 5,000 × 10⁶ = 38,750
- 长期西格玛水平 Z_long = Φ⁻¹(1 − 38,750/10⁶) = Φ⁻¹(0.96125) ≈ 1.766
- 短期西格玛水平 Z_short = Z_long + 1.5 = 3.27σ
一个细节(体现专业性): 若用 Poisson 近似(RTY ≈ e^(−DPU_total)),DPU_total = 193.75/1,000 = 0.19375 → e^(−0.19375) = 82.38%,与连乘的 80.63% 差 1.75 个百分点。差异来自"缺陷在单位上非随机分布"的假设偏离。实务中应以连乘法为准,Poisson 近似仅用于快速估算。
4.5 库存周转率与 DOS
算例 4-3:库存改善的资金释放
假设(以企业实际财务口径为准):
- 年销售成本 COGS = 12,000 万元
- 期初库存 2,100 万元,期末库存 2,700 万元 → 平均库存 = (2,100 + 2,700) / 2 = 2,400 万元
计算:
- 周转次数 = 12,000 / 2,400 = 5.0 次/年
- 库存天数 DOS = 365 / 5.0 = 73 天
改善方案:库存降到 2,000 万元
- 新周转次数 = 12,000 / 2,000 = 6.0 次/年
- 新 DOS = 365 / 6.0 = 61 天
- 释放资金 = 2,400 − 2,000 = 400 万元
- 按资金成本 6%/年估算(以企业实际资金成本为准)→ 年节省 24 万元
注意:降库存不能只看资金收益,还要评估缺货风险。 正确做法是配套计算安全库存(见配套阅读中的库存模型文章),并在看板上同时监控"库存天数"与"缺货次数"这对对冲指标。
4.6 设备可靠性 MTBF / MTTR / 可用率
算例 4-4:一条产线的设备可靠性
观察期 30 天 × 20 h/天 = 600 h;期间故障 5 次,总维修时间 20 h。
- MTBF(平均无故障工作时间)= (600 − 20) / 5 = 116 h
- MTTR(平均修复时间)= 20 / 5 = 4 h
- 固有可用率 A = MTBF / (MTBF + MTTR) = 116 / 120 = 96.67%
改善的两个方向:
| 方向 | 目标 | 手段 | 难度 |
|---|---|---|---|
| 提 MTBF | 故障间隔从 116 h → 150 h | 预防性维护(PM)制度化、备件质量、操作标准化、根因分析 | 中~高(长期工程) |
| 降 MTTR | 修复时间从 4 h → 2.5 h | 备件可得性、维修 SOP、故障树快速定位、维修技能矩阵 | 低~中(见效快) |
MTTR 从 4 h 降到 2.5 h 的效果验证:
- 总维修时间 = 5 × 2.5 = 12.5 h
- 新 MTBF = (600 − 12.5) / 5 = 117.5 h
- 新可用率 = 117.5 / 120 = 97.92%(提升 1.25 pp)
- 释放运行时间 = 20 − 12.5 = 7.5 h/月 = 90 h/年
IE 的建议:先降 MTTR,再提 MTBF。 因为降 MTTR 的手段(备件、SOP、技能)通常投入小、见效快、易验证;提 MTBF 是长期工程,需要可靠性数据积累。
4.7 劳动生产率
算例 4-5:人均产出与工时效率
假设:月产出 45,000 件,直接人工 25 人,当月 26 个工作日 × 8 h = 208 h/人。
- 总直接工时 = 25 × 208 = 5,200 h
- 人均月产出 = 45,000 / 25 = 1,800 件/人·月
- 工时效率 = 45,000 / 5,200 = 8.65 件/工时
改善后:产出 48,000 件,人工 24 人
- 人均月产出 = 48,000 / 24 = 2,000 件/人·月(+11.1%)
- 总工时 = 24 × 208 = 4,992 h
- 工时效率 = 48,000 / 4,992 = 9.61 件/工时(+11.1%)
注意两个坑:
- 人均产出上升不一定是真的效率提升。 如果产出增长来自加班(工时不变但实际投入增加),或来自外协(把内部工序外包),人均产出会虚高。必须与工时效率交叉验证。
- 劳动生产率要与质量、安全指标一起看。 单纯追效率常导致返修率上升或安全隐患。
4.8 计划达成率:总量掩盖结构
算例 4-6:为什么"达成 95%"还不够
| 型号 | 计划产量 | 实际完工 | 达成率 |
|---|---|---|---|
| A | 500 | 480 | 96.0% |
| B | 400 | 400 | 100.0% |
| C | 300 | 260 | 86.7% |
| 合计 | 1,200 | 1,140 | 95.0% |
三种口径:
- 总量达成率 = 1,140 / 1,200 = 95.0%
- 按计划量加权的型号达成率 = (500×0.96 + 400×1.00 + 300×0.867) / 1,200 = (480 + 400 + 260) / 1,200 = 95.0%(与总量一致,因为分母相同)
- 型号齐套率(所有型号都达标)= 1 / 3 = 33.3%
关键洞察: 如果你的产品需要 A、B、C 三件配套才能出货(如一台设备需要三种部件),那么真正能出货的比例不是 95%,而受制于最短板 C(86.7%)。总量达成率在配套生产场景下系统性高估交付能力。
正确做法: 对配套型产品,主指标用**"齐套率"或"按订单的完整交付率(OTIF)"**,总量达成率仅作参考。
五、数据采集:从纸单到自动,以及如何判断数据可不可信
5.1 数据成熟度四级
| 级别 | 特征 | 典型采集方式 | 数据可信度(参考区间,以实测为准) |
|---|---|---|---|
| L0 无数据 | 凭经验判断,无记录 | 口头、记忆 | 不可用 |
| L1 纸单 + 事后录入 | 有记录,但滞后且易丢失 | 纸质工单、Excel 事后补录 | 低(完整性、及时性均差) |
| L2 结构化人工录入 | 系统表单 + 必填校验 | 工位终端、PDA、扫码枪 | 中(及时性好,准确性依赖人) |
| L3 自动采集 | 设备/传感器直采,无需人工 | PLC、SCADA、IoT、MES 自动报工 | 高(需验证传感器与口径) |
IE 的实务判断:不要一上来就追求 L3。 很多改善项目在 L1 阶段就能完成 80% 的分析——你需要的是"数据能回答问题",不是"数据很先进"。
建议路径:
- 先用 L1/L2 把指标体系与口径跑通(这个阶段会暴露大量定义问题)
- 跑通后再投资 L3 自动化,否则你会把错误的口径自动化成"高效地产生错误数据"
5.2 采集方案选型对照
| 方案 | 初期投入 | 维护成本 | 时效性 | 数据丰富度 | 适用 |
|---|---|---|---|---|---|
| 纸质表单 + Excel | 极低 | 高(人工录入) | 差(天级) | 低 | 试点、临时分析 |
| 共享 Excel / 在线表格 | 低 | 中 | 中(小时级) | 中 | 小团队、单产线 |
| 扫码/PDA 报工 | 中 | 低 | 好(分钟级) | 中 | 工序流转、批次追踪 |
| MES 自动报工 | 高 | 中 | 好(秒~分钟级) | 高 | 多工序、需追溯 |
| PLC/SCADA 直采 | 高 | 低 | 优(秒级) | 高(设备侧) | 设备状态、节拍、能耗 |
| IoT 传感器加装 | 中~高 | 中 | 优 | 高 | 老设备改造、能耗、环境 |
| 视觉/机器视觉 | 高 | 中 | 优 | 高 | 计数、缺陷检测、动作分析 |
选型三问:
- 这个数据用来做什么决策?(日报 → 小时级足够;实时调度 → 需要秒级)
- 不采这个数据会怎样?(不影响决策的数据,不要采——采集本身也是成本)
- 数据错了能被发现吗?(有没有交叉校验机制)
5.3 数据质量四维度:乘法效应
算例 5-1:三个 90% 加起来不是 90%
某厂 MES 停机数据的质量抽查结果:
| 维度 | 定义 | 实测 | 说明 |
|---|---|---|---|
| 完整性 | 应记录 6,000 条,实际录入 5,460 条 | 91% | 有 540 条停机未记录 |
| 及时性 | 应 1 h 内录入,实际 1 h 内录入的比例 | 82% | 18% 的记录是事后补录 |
| 准确性 | 抽核 200 条,18 条原因分类错误 | 91% | 停机原因填写不规范 |
| 一致性 | MES 与 ERP 产量差异 | 99.4% | 较好 |
综合可信度(乘法模型):
0.91 × 0.82 × 0.91 × 0.994 = 0.675 → 67.5%
这是全篇最反直觉的一个数字:四个看起来都"80%~99%"的质量维度,乘起来只有 67.5%。 意味着你在看板上看到的每一个停机数字,都有约三分之一的概率是不完整、不及时或不准确的。
管理含义:
- 数据质量必须用乘法模型汇报,不能用平均分。 平均分 90.8% 会让人误以为"还不错"。
- 改善数据质量要找最短板。 上例中及时性 82% 是瓶颈,把它提到 92%,综合可信度立刻升到 75.7%(+8.2 pp);而把已经很好的一致性从 99.4% 提到 99.9%,只带来 +0.3 pp。
- 数据质量本身应该上墙。 在指标看板旁边放一个"数据健康度"小组件,让所有人知道这个数字能信几分。
六、看板设计:让数字变成行动
6.1 图表选型决策表
| 你想表达什么 | 推荐图表 | 避免 |
|---|---|---|
| 趋势(随时间变化) | 折线图(配 MA7)、控制图 | 柱状图(点数多时不可读) |
| 对比(A vs B) | 柱状图、条形图 | 饼图(无法精确比较) |
| 构成(部分占整体) | 堆叠柱状图、瀑布图 | 3D 饼图(严重失真) |
| 分布(数据散布形态) | 直方图、箱线图、散点图 | 只看均值 |
| 关系(两变量相关) | 散点图 + 趋势线 | — |
| 达成 vs 目标 | 子弹图(Bullet Chart)、仪表盘 | 大号数字 + 红绿灯 |
| 异常定位 | 帕累托图(降序柱 + 累计线) | 平均分配的饼图 |
| 流程/时序 | 甘特图、泳道图 | 表格 |
| 多层次占比 | 树图(Treemap) | 多层饼图 |
三条硬性规则:
- 不超过 5 种颜色,且颜色必须有语义(如:达标=灰,预警=黄,报警=红,目标线=蓝)。
- 不用 3D 效果、不用渐变、不用装饰性图标。 每一个视觉元素要么承载信息,要么删掉。
- 数字要有对比基准。 单独一个"OEE 75.4%"没有意义;"75.4%(目标 85%,上月 78.1%)"才有意义。
6.2 控制图:看板上必须有的一条线
大部分看板只画"实际值 vs 目标线",这有个致命缺陷:无法区分正常波动与真正异常。结果就是要么天天报警(狼来了),要么真异常被当成噪声。
解法是把控制限画上去。 对于单值数据(如每日 OEE、每日产量),用 X-MR 图(单值-移动极差图)。
算例 6-1:OEE 日值的 X-MR 控制图
20 天的 OEE 日值(%):
72.1, 74.5, 73.2, 75.8, 71.0, 76.4, 74.9, 73.6, 75.1, 62.3,
73.8, 74.2, 72.9, 75.5, 73.1, 74.7, 76.0, 72.4, 74.0, 73.5
X 图(单值图):
- 均值 X̄ = 1,469.0 / 20 = 73.45%
- 移动极差 MR(相邻两值之差的绝对值,共 19 个): 2.4, 1.3, 2.6, 4.8, 5.4, 1.5, 1.3, 1.5, 12.8, 11.5, 0.4, 1.3, 2.6, 2.4, 1.6, 1.3, 3.6, 1.6, 0.5
- MR̄ = 60.4 / 19 = 3.179
- 估计标准差 σ̂ = MR̄ / d₂ = 3.179 / 1.128 = 2.818(d₂ = 1.128 为 n = 2 时的常数)
- UCL = X̄ + 3σ̂ = 73.45 + 8.45 = 81.90%
- LCL = X̄ − 3σ̂ = 73.45 − 8.45 = 65.00%
判异:第 10 天 OEE = 62.3% < LCL 65.00% → 判为异常。
MR 图(移动极差图):
- UCL_MR = D₄ × MR̄ = 3.267 × 3.179 = 10.38
- MR 值 12.8(第 9→10 天)和 11.5(第 10→11 天)均超过 10.38 → 判为异常
两图同时判异,确认第 10 天存在特殊原因(如设备故障、停产、大批量返工),需追溯。
剔除异常点后重算控制限(这一步很多人忘了做):
- 剔除 62.3 后:n = 19,和 = 1,469.0 − 62.3 = 1,406.7 → 新 X̄ = 74.04%
- MR 重算:去掉 12.8 和 11.5,新增 |73.8 − 75.1| = 1.3 → 新 MR 和 = 60.4 − 24.3 + 1.3 = 37.4,MR 个数 = 18
- 新 MR̄ = 37.4 / 18 = 2.078;新 σ̂ = 2.078 / 1.128 = 1.842
- 新 UCL = 74.04 + 5.53 = 79.57%;新 LCL = 74.04 − 5.53 = 68.51%
注意新控制限变窄了(±8.45 → ±5.53)。 这意味着过程其实比想象的更稳定,剔除特殊原因后,日常波动只有 ±5.5 个百分点。这个信息对后续设定目标值很有价值:如果目标设 85%,它远在控制限之外,说明靠"日常管理"达不到,必须做系统性改善(而不是靠现场努力)。
这是控制图给看板带来的最大价值:区分"该由现场处理"和"该由系统改善解决"的问题。
6.3 异常触发规则
红绿灯只看单点阈值是不够的。推荐叠加以下规则(源自控制图判异准则的简化版):
| 规则 | 触发条件 | 说明 | 误报率 |
|---|---|---|---|
| R1 | 单点超过 3σ 控制限 | 明显异常 | 极低 |
| R2 | 连续 9 点位于中心线同侧 | 过程发生偏移 | 低 |
| R3 | 连续 6 点递增或递减 | 趋势性变化(如刀具磨损) | 低 |
| R4 | 连续 3 点中有 2 点超过 2σ | 早期预警 | 中 |
| R5 | 单点超过目标值 ± 固定阈值 | 业务规则(最直观) | 取决于阈值设定 |
实务建议:
- R1 + R2 + R5 是最小可用组合,同时启用不会造成过多误报
- R4 作为预警(黄色)而非报警(红色)
- 所有触发都要有"确认/关闭"动作,否则告警会堆积成噪音
6.4 看板布局:一屏原则与三层钻取
一屏原则: 每个角色的主看板必须能在一屏内看完,不需要滚动、不需要切换。
5 秒原则: 看板的核心信息(是否达标、哪里异常)应在 5 秒内被识别。测试方法:让不熟悉的人看 5 秒,然后问他"今天有没有问题"。
三层钻取:
第一层:状态层(红/黄/绿 + 关键数字) ← 5 秒
↓ 点击异常项
第二层:归因层(帕累托、损失分解、TOP3)← 30 秒
↓ 点击具体项
第三层:明细层(原始记录、时间序列、关联单据)← 5 分钟
不要让第一层就堆满细节。 最常见的错误是把明细表当看板——那是报表,不是看板。
典型产线日看板布局示例:
┌──────────────────────────────────────────────────────────┐
│ A 线 · 白班 · 2026-09-05 数据健康度: 88% 🟢 │
├───────────┬───────────┬───────────┬──────────────────────┤
│ 产量达成 │ OEE │ FPY │ 停机时长 │
│ 1,140/ │ 75.4% │ 97.0% │ 45 min │
│ 1,200 │ 目标 85% │ 目标 98% │ 目标 ≤30 min │
│ 🟡 95% │ 🔴 │ 🟡 │ 🔴 │
├───────────┴───────────┴───────────┴──────────────────────┤
│ 近 20 天 OEE 趋势(含 UCL/LCL/目标线/MA7) │
│ [控制图区域] │
├──────────────────────────────────────────────────────────┤
│ 今日停机原因帕累托(TOP5 + 累计线) │
│ 换型 18min ████████ 40% │
│ 故障 15.8min ███████ 35% │
│ 待料 6.8min ███ 15% │
│ 其他 4.5min ██ 10% │
├──────────────────────────────────────────────────────────┤
│ ⚠ 待办:① 换型超时 3 次 → IE 张工 · 今日 16:00 前反馈 │
│ ② 第 10 天 OEE 异常 → 已完成根因,待关闭 │
└──────────────────────────────────────────────────────────┘
看板底部那个"待办区"是最容易被忽略却最重要的部分。 没有它,看板就是一块显示数字的海报。
6.5 看板三问与责任人矩阵
| 看板 | 谁看 | 多久看一次 | 看完做什么 | 不达标时找谁 |
|---|---|---|---|---|
| L4 工位看板 | 操作工、班组长 | 每 1~2 h | 调整节拍、呼叫支援 | 班组长 |
| L3 产线日看板 | 车间主任、IE、设备、质量 | 每班/每日 | 分配改善任务、开停机分析会 | 对应工程师 |
| L2 部门周看板 | 部门经理 | 每周 | 资源调配、跨部门协调 | 部门经理 |
| L1 月度经营看板 | 厂级管理层 | 每月 | 投资决策、目标调整 | 厂长 |
每一块看板都必须有一个"所有者" ——负责口径维护、数据质量、看板更新。没有所有者的看板会在三个月内变成过期数据。
七、五大反模式与指标"游戏化"的破解
7.1 五大反模式
| 反模式 | 表现 | 后果 | 对策 |
|---|---|---|---|
| 虚荣指标 | 指标只会变好,从不暴露问题 | 掩盖问题 | 加入"不达标也能显示"的指标;用控制图暴露波动 |
| 单指标考核 | 只考一个数字 | 必然被博弈 | 用指标组合(见 7.2) |
| 指标通胀 | 屏幕上有 40 个指标 | 等于没有指标 | 每层限 5~15 个,定期清理 |
| 滞后指标为主 | 只看月度财务结果 | 无法实时干预 | 至少 50% 是过程指标(前置指标) |
| 指标不退役 | 三年前的指标还在墙上 | 与当前战略脱节 | 每半年评审一次,强制淘汰 |
7.2 用"对冲指标"破解游戏化
核心思想:任何被考核的指标,都要配一个能暴露其副作用的对冲指标。
| 主指标 | 可能的博弈行为 | 对冲指标 |
|---|---|---|
| 设备利用率 ↑ | 过量生产、WIP 堆积 | WIP 周转天数、在制资金占用 |
| 产量达成率 ↑ | 提前生产不需要的型号 | 库存天数、呆滞物料金额 |
| OEE ↑ | 只做容易的产品、拒绝换型 | 换型次数、产品覆盖度、OTIF |
| 单位成本 ↓ | 降低检验强度、推迟维护 | 客户退货率、故障停机时长 |
| 人均产出 ↑ | 过度加班、外包内部工序 | 加班工时占比、外协金额、安全事故数 |
| 交付周期 ↓ | 插队、挤压小订单 | 小订单准时率、订单排队公平度 |
| 库存 ↓ | 缺货频发 | 缺货次数、紧急采购金额 |
规则:主指标与对冲指标必须同时上墙、同时汇报。 只汇报主指标的报告,应被视为不完整。
7.3 前置指标 vs 滞后指标
| 类型 | 定义 | 例子 | 作用 |
|---|---|---|---|
| 滞后指标(Lagging) | 结果发生后才能测量 | 月度不良率、客户退货率、OEE、成本 | 评价结果 |
| 前置指标(Leading) | 预示未来结果的过程量 | PM 完成率、首件确认执行率、换型演练次数、培训覆盖率 | 预测与干预 |
IE 应主动提高前置指标的占比。 理由很简单:滞后指标变差时,损失已经发生;前置指标变差时,你还有机会。
一个经典例子: 设备可用率是滞后指标;PM(预防性维护)计划完成率是它的前置指标。如果 PM 完成率连续两个月低于 85%,几乎可以肯定未来 3~6 个月故障停机会上升。看板上应该同时显示这两个指标,并在前置指标恶化时提前行动。
八、落地路线与 40 项检查清单
8.1 十二周落地路线
| 阶段 | 周次 | 关键动作 | 交付物 |
|---|---|---|---|
| 诊断 | W1–W2 | 盘点现有报表与指标,识别口径冲突 | 指标现状清单、冲突点清单 |
| 定义 | W3–W4 | 为核心指标填写定义卡(12 要素) | 指标定义卡(8~15 张) |
| 基线 | W5–W6 | 用历史数据回算,验证公式与数据源 | 基线值、数据质量评估报告 |
| 原型 | W7–W8 | 做一个产线的看板原型,跑两周 | 可交互原型、用户反馈 |
| 试点 | W9–W10 | 正式上线试点看板,配套行动规则与责任人 | 上线看板、行动记录 |
| 推广 | W11–W12 | 复制到其他产线/车间,建立评审机制 | 全厂看板体系、评审制度 |
不要跳过 W5–W6(基线验证)。 我见过的失败项目中,超过一半是在这个阶段发现"公式算出来的数和实际对不上",而此时如果已经上线,信任就毁了。
8.2 检查清单(40 项)
A. 指标设计(10 项)
- 每个上墙指标都有完整的定义卡(12 要素填齐)
- 上层指标能通过下层指标解释(指标树已建立)
- 每层指标数量在建议范围内(L1 5
8 / L2 1015 / L3 812 / L4 35) - 时间类指标同时定义了 P50 / P90 / 达标率
- 比率类指标明确了聚合规则(加权方式)
- 每个指标都有唯一责任人(到岗位,不到部门)
- 每个指标都有目标值 + 预警阈值 + 报警阈值
- 每个指标都有明确的行动规则(超限做什么、多久内做)
- 每个被考核指标都配了至少 1 个对冲指标
- 前置指标占比不低于 30%
B. 口径与公式(8 项)
- 分子、分母的"含什么/不含什么"已写死
- 多系统取数已明确唯一数据源(避免三套数字)
- 跨零点班次的日期归属规则已明确
- 异常值剔除规则已事前定义,且剔除有留痕
- 累计 vs 移动平均的使用场景已区分
- 所有 OEE 类指标的分母口径已声明(日历/计划/负荷)
- 型号/工序合并时的加权方式已验证(与算术平均对比过)
- 公式在至少 3 组历史数据上做过回算验证
C. 数据质量(8 项)
- 四维度(完整性/及时性/准确性/一致性)已有测量方法
- 综合可信度用乘法模型计算并展示
- 数据质量的最短板已识别并有改进计划
- 关键数据有交叉校验机制(如 MES 产量 vs 入库数)
- 人工录入字段有必填校验与可选值约束
- 传感器/自动采集设备有定期校准记录
- 数据缺失时有明确的"补录/标注"流程,不留空
- 数据健康度在看板上可见
D. 看板设计(8 项)
- 满足一屏原则(无需滚动即可看完)
- 通过 5 秒测试(不熟悉的人能看出是否有问题)
- 趋势类图表已画上控制限(UCL/LCL),不止画目标线
- 颜色不超过 5 种,且颜色有语义
- 无 3D、渐变、装饰性元素
- 每个数字都有对比基准(目标 / 上期 / 同期)
- 支持三层钻取(状态 → 归因 → 明细)
- 底部有"待办/责任人/时限"区域
E. 运营与治理(6 项)
- 每块看板有明确所有者,负责口径维护与更新
- 有告警的确认/关闭机制,无堆积僵尸告警
- 每半年进行一次指标评审,强制淘汰过时指标
- 指标变更有版本记录与通知机制
- 使用方(班组长、操作工)参与过设计评审
- 有看板使用情况的反馈渠道(数字看不懂?指标没用?)
小结
做数据看板,技术是最后一环,前两环是定义和信任。六个核心结论:
第一,指标定义卡是地基。 12 个要素填不完,后面所有工作都会返工。其中分母定义与聚合规则最易出错——三条产线的 OEE,算术平均 72.81% 与加权 70.11% 差 2.7 个百分点;五工序的合格率,算术平均 95.80% 与实际流通合格率 80.63% 差 15.17 个百分点。
第二,分母必须写死。 同一现场,OEE 可以是 75.45%(负荷时间口径)或 70.74%(计划时间口径)或 23.58%(日历时间口径),全都正确。混用口径比没有指标更糟。
第三,均值会系统性掩盖长尾。 交付提前期均值 8.8 天看起来达标,实际 P90 是 16.8 天、达标率只有 73.3%。时间类指标必须 P50 + P90 + 达标率三件套。
第四,数据质量是乘法不是加法。 四个维度 91%、82%、91%、99.4%,乘起来只有 67.5%。改善要找最短板,不是平均分。
第五,看板上必须画控制限。 算例 6-1 中,剔除异常点后控制限从 ±8.45 收窄到 ±5.53,这个信息告诉你:85% 的目标在日常管理范围之外,必须做系统性改善。没有控制限的看板,要么天天狼来了,要么真异常被当噪声。
第六,任何被考核的指标都要配对冲指标。 主指标与对冲指标同时上墙,是破解"指标游戏化"最有效的手段。
最后一句: 看板的目的不是显示数字,是改变行为。如果一个看板上线三个月后,没有任何一个决策因为它而改变,那它就是一块昂贵的屏幕。
配套阅读
- OEE 设备综合效率:三个因子背后的真实产能 — 本文第 3.4 与 4.1 节的详细展开
- SPC 统计过程控制:控制图判异与过程能力 Cpk — 第 6.2 节 X-MR 图的方法基础
- 标准工时与工时测量:从秒表到宽放率 — 第 3.6 节异常值剔除规则的完整背景
- 工业工程师的 Excel 实战手册:30 个技法 — 本文所有算例的表格实现方法
- 供应链与库存模型基础:安全库存与订货策略 — 第 4.5 节库存天数与安全库存的配套计算
- Python for IE:数据处理与分析的实用路径 — 从 Excel 走向自动化分析的下一步
- IE 软件地图:Excel / Python / CAD / 仿真 / ERP-MES — 第 5.2 节采集方案选型的工具参考
- 质量管理七项原则:从 ISO 9001 条文到车间动作 — 第 2.1 节指标体系与战略对齐的原则来源
- 可靠性与 FMEA/FTA:MTBF、MTTR 与维修策略 — 第 4.6 节设备可靠性指标的方法延伸
- 运筹学在工业工程中的落地:从建模到求解 — 指标树与资源分配的优化建模基础
相关阅读
- SQL 工业工程数据分析实战:从 MES 取数到指标看板:IE 日常有 60% 的时间花在等数据上。本文从真实取数场景出发,讲透 SQL 核心语法(S…
- OEE 设备综合效率:定义、算法、达标线与常见误用:用完整算例讲清 OEE 三大因子与时间口径,拆解六大损失,给出世界级达标线与 MTBF/MT…
- TPM 全员生产维护完全指南:OEE、自主保全与零故障的八根支柱:设备一停,全线的产出就没了。本文讲透 TPM 完整体系:OEE 三要素的时间分解与六大损失(…
- 工业工程必备软件地图:从 Excel 到 FlexSim,每个阶段该学什么:按学习阶段给出 IE 的软件全景图:Excel、统计分析、仿真建模、CAD、企业系统,并给出…
- 运筹学在工业工程里的落地:线性规划、排队论与仿真:从产品组合的线性规划算例讲到影子价格与瓶颈判断,详解 M/M/1 与 M/M/c 排队模型算…