能力指数是体检报告,控制图是心电监护。体检结果好,不等于可以把监护仪拔了。
这两样东西的时间属性完全不同:
拿一份三个月前的体检报告,证明今天不用量血压,逻辑上就不成立。
能力高确实有价值,价值在于它给了你更厚的缓冲垫。可缓冲垫只有在你还盯着的时候才叫缓冲垫;不盯了,它只是把暴雷时间往后推,顺便把暴雷时的批量做得更大。
能力和均值偏移之间有个很干脆的关系:
``` Cpk = Cp × (1 − k) ,其中 k = |μ − M| / (T/2) ```
M 是公差中心,T 是公差带宽。拿 Cp=1.67(此时 T/2 = 5σ)算一张表:
| 均值漂移量 | k | Cpk | 最近端 z 值 | 单边不合格 ppm |
|---|---|---|---|---|
| 0 | 0 | 1.67 | 5.0 | 0.29 |
| 0.5σ | 0.10 | 1.50 | 4.5 | 3.4 |
| 1.0σ | 0.20 | 1.33 | 4.0 | 31.7 |
| 1.5σ | 0.30 | 1.17 | 3.5 | 233 |
| 2.0σ | 0.40 | 1.00 | 3.0 | 1350 |
| 2.5σ | 0.50 | 0.83 | 2.5 | 6210 |
| 3.0σ | 0.60 | 0.67 | 2.0 | 22750 |
看这条曲线的陡度:均值只漂 1σ,不合格率涨了 100 倍;漂 2σ,涨 4600 倍。 而 1σ 的漂移,在车间是什么级别的事?换一批料、换一次刀、室温升 5 度,都能做到。
关键在于:这个漂移,控制图能第一时间看见,能力报告要等下个季度。

这话听着别扭,但车间里就是这么回事,原因有三条:
监控被放松。 Cpk 高 → 大家觉得安全 → 频次降低 → 漂移无人发现。这是最主要的。
报警被当成噪声。 高能力过程的控制限窄(σ 小),点子稍有风吹草动就出界,但因为离规格限还很远,操作工会形成"报警了也没事"的条件反射,慢慢地就不响应了。这叫报警疲劳,比不报警还危险。
问题积累的批量大。 正因为长时间不出废品,等到真出废品时,可疑批已经堆了几个月的量,追溯范围大得吓人。
能力充足确实可以降低监控强度,这在汽车行业的过程控制要求里是认可的做法。但它是分级,不是取消,而且必须有明文依据和复评机制。
| Cpk / Ppk 水平 | 监控强度 | 反应计划 |
|---|---|---|
| ≥ 1.67 | 频次可降档(如 1h/n=5 → 2h/n=5),控制图保留 | 常规判异响应;可评估改用修正控制限 |
| 1.33 ~ 1.67 | 标准频次,标准控制图 | 常规判异响应 |
| 1.00 ~ 1.33 | 频次加严,缩短子组间隔 | 报警必须停机分析 + 立项改善 |
| < 1.00 | 100% 检验 | 遏制 + 通知客户 + 短期纠正 + 长期改善 |
三条硬规矩:
能力富余很大时,还有一个正规做法:修正控制限(modified control limits),也就是验收控制图那一套思路。
逻辑很朴素——过程能力足够宽裕时,均值并不需要死死钉在中心,它在一个带子里游动也不会产生不合格品。那就把控制限按"允许的最大不合格率"重新算:
``` 允许的过程均值上界:μ_U = USL − Z_δ · σ 允许的过程均值下界:μ_L = LSL + Z_δ · σ
UCL_modified = μ_U + 3σ/√n = USL − Z_δ·σ + 3σ/√n LCL_modified = μ_L − 3σ/√n = LSL + Z_δ·σ − 3σ/√n ```
Z_δ 由你能接受的不合格率 δ 定:δ=0.135% 取 3.00,δ=0.1% 取 3.09,δ=0.01% 取 3.72。
举个数:USL=12.525,LSL=12.475,σ=0.0047,n=4,取 δ=0.135%(Z_δ=3.0):
``` μ_U = 12.525 − 3.0×0.0047 = 12.5109 UCL_mod = 12.5109 + 3×0.0047/2 = 12.5109 + 0.0071 = 12.5180 常规 UCL = 12.500 + 0.0071 = 12.5071 ```
修正限比常规限宽了不少,但它宽得有账可算——只要均值不超过 12.5109,不合格率就保证在 0.135% 以内。
这才叫放松:放松要有算法,不能有情绪。 "报警太多,把限放宽点"是情绪;"能力富余,按 δ=0.135% 重算限"是算法。两者写在纸上可能都是"把限调宽了",性质天差地别。
(1)建限与首次能力研究
某 CNC 铣削工位,孔径 φ12.500 ±0.025 mm,n=4 子组,每小时一次。
``` X̿ = 12.5002 ,R̄ = 0.00968 ,d₂(n=4) = 2.059 σ̂ = 0.00968 / 2.059 = 0.00470 mm Cp = 0.050 / (6 × 0.00470) = 1.77 Cpk = min(12.525−12.5002, 12.5002−12.475) / (3×0.00470) = 0.0248/0.0141 = 1.76 ```
漂亮。于是工艺科决定:控制图取消,改为"每周首件三坐标确认"。
(2)六个月后的实际状态
季度能力复评被推迟了两次,直到客户投诉才重做:
``` 新 X̿ = 12.5105 mm (较原中心漂 +0.0105 mm) 新 σ̂ = 0.00610 mm (导轨磨损,变差也劣化了) ```
分两步看这半年发生了什么:
只算漂移的影响(σ 仍按 0.0047):
``` 漂移量 = 0.0105 / 0.0047 = 2.23σ Cpk = (12.525 − 12.5105) / (3×0.00470) = 0.0145 / 0.0141 = 1.03 ```
再叠加 σ 劣化:
``` Cpk = 0.0145 / (3×0.00610) = 0.0145 / 0.0183 = 0.79 Cp = 0.050 / (6×0.00610) = 1.37 ```
Cpk 从 1.76 掉到 0.79。对应不合格率:
``` z = 3 × 0.79 = 2.38 → 单边不合格率 = 0.0087 = 8700 ppm 半年产量 18 万件 × 8700 ppm ≈ 1566 件带风险 ```
一千五百多件,全部已发运。追溯范围:六个月,因为没有控制图,说不清漂移是哪天开始的——只能全批召回评估。
(3)如果控制图还在,会在哪一天报警
保留每小时 n=4 的 Xbar 图:
``` σ_X̄ = 0.00470 / √4 = 0.00235 UCL = 12.5002 + 3 × 0.00235 = 12.5073 ```
漂移 +0.0105 之后的新均值 12.5105:
``` z = (12.5073 − 12.5105) / 0.00235 = −1.36 P(单点超 UCL) = 0.913 → ARL₁ ≈ 1.1 ```
下一个子组、也就是一小时之内就会报警。 就算漂移是慢慢来的,按"连续 9 点同侧"准则,也顶多拖 9 小时。
对比一下代价:
| 项目 | 保留控制图 | 取消控制图 |
|---|---|---|
| 发现时间 | 1 小时~1 个班 | 6 个月(客户投诉触发) |
| 追溯范围 | 1 个班次约 400 件 | 6 个月约 18 万件 |
| 带风险流出件 | 0 | ≈1566 件 |
| 节省的监控工时 | — | 约 3000 工时 |
| 实际发生的损失 | — | 召回评估 + 客户罚款 + 评级下降 |
三千工时省下来了,赔进去的远不止这个数。
(4)整改后的方案
不是简单恢复原状,而是按分级监控重新配:
``` Cpk ≥ 1.67 时:每 2 小时 n=4(频次降一档,但图保留) Cpk 1.33~1.67:每小时 n=4(标准) Cpk < 1.33:每 30 分钟 n=5 + 立项改善 季度能力复评,进入 ERP 计划,逾期锁单 ```
同时把导轨磨损做成了预测性维护项,按累计切削时长强制保养。


咱把这事捋顺了:能力高 = 缓冲垫厚 ≠ 可以不看。缓冲垫的作用是给你反应时间,不是替你反应。
真想省工时,路子是有的——分级降频、修正控制限、自动采集替代手工记录,每一条都有算法支撑。唯独"撤图"这一条,怎么算都算不过来。
互动提问:你们厂有没有哪道工序,因为"能力一直很好"而把控制图停了或者降到很低的频次?如果现在让你把这个决定写成一份带算法依据的降档说明,你写得出来吗?
如需配套互动练习、培训课件或软件试用,可搜索「东方大易」或访问大易官网 www.eastdayi.com(苏州东方大易管理咨询有限公司,电话 0512-65561989)联系客服获取。