SPC·实战笔记
模块七 · 过程能力进阶与实战 · 实战

小样本能力评估:数据不够怎么办

新项目 PPAP,客户要 Ppk ≥ 1.67,可试产总共就跑了 30 件。我们算出 1.82,报告一交,客户的统计工程师回了一句:"请附上 95% 置信下限。"我们算完傻眼了——下限只有 1.42。同一份数据,一个说合格,一个说没证明。这两个数字的差距,就是小样本的代价。

一、先说结论

Cpk 和 Ppk 是估计值,不是测量值。 你算出来的那个 1.82,跟真值之间隔着一整个抽样分布。样本越小,这个分布越宽,宽到什么程度?给你个数感受一下:

n = 10 的时候,点估计 1.33 对应的 95% 置信下限只有 0.79。

也就是说,拿 10 个数据算出 1.33,你连"这个过程能不能到 0.8"都不敢打包票。可现实里有多少初期能力报告,就是拿十来个件凑出来的?

小样本的正确姿势不是"想办法把数字算大点",而是这三件事:

  1. 报点估计的同时,必须报置信下限
  2. 数据非正态或者形状怪时,用 Bootstrap 求经验区间
  3. 样本实在不够,就换证据链——机器能力 Cm、同族件历史数据、防错措施一起上,别硬凑一个 Ppk。

二、核心知识点拆解

2.1 Cpk 的抽样分布有多宽

Ĉpk 的标准误有个业内常用的近似式(Bissell 近似):

$$SE(\hat{C}_{pk}) \approx \hat{C}_{pk}\sqrt{\frac{1}{9n\hat{C}_{pk}^2} + \frac{1}{2(n-1)}}$$

单侧 95% 置信下限:

$$LCL_{95\%} = \hat{C}_{pk} - 1.645 \times SE(\hat{C}_{pk})$$

把 Ĉpk = 1.33 代进去,看不同样本量下的置信下限:

样本量 nSE95% 置信下限这个下限意味着
100.3310.79等于什么都没证明
250.2031.00连 1.0 都刚够着
300.1851.03PPAP 常见样本量
500.1421.10稍微像话了
1000.1001.17能拿出手
2000.0711.21接近可信

看最后一行:哪怕 200 个数据,点估计 1.33 的置信下限也才 1.21。 能力指数这东西天生"贵",想把它算准,要的样本量比大多数人想象的多一个量级。

反过来讲,这张表也解释了一件长期让人困惑的事——为啥 PPAP 初期能力要求 1.67,量产 Cpk 只要 1.33? 那 0.34 的差额,一部分是给长期变差留的余量,另一部分就是给小样本的统计不确定性买单。

Cpk 置信区间收敛图。横轴样本量 n(对数刻度 10 / 25 / 50 / 100 / 200 / 500),纵轴 Cpk 值 0.6~2.0。中间画一条水平深蓝实线 = 点估计 1.33;上下各一条向右收敛的曲线包住一个浅蓝色"喇叭形"置信带,喇叭口在左(n 小)张得极大、往右迅速收窄。在 1.33 处画金橙水平…
图 1 · Cpk 置信区间收敛图。横轴样本量 n(对数刻度 10 / 25 / 50 / 100 / 200 / 500),纵轴 Cpk 值 0.6~2.0。中间画一条水平深蓝实线 = 点估计 1.33;上下各一条向右收敛的曲线包住一个浅蓝色"喇叭形"置信带,喇叭口在左(n 小)张得极大、往右迅速收窄。在 1.33 处画金橙水平虚线标"客户要求",在 n=10 处用红色竖线标出下限 0.79 并加文字"点估计 1.33,下限 0.79"。图注:"样本量不是走个形式,它决定你的结论有多硬"。

2.2 Bootstrap:不假设正态的笨办法

上面那个公式有个前提——数据近似正态。真实车间里,形位公差、单侧特性、经过全检筛过的数据,都不正态。这时候 Bootstrap 更靠谱。

Bootstrap 的操作土得掉渣,但特别管用:

  1. 手上有 n 个原始数据;
  2. 有放回地从这 n 个里随机抽 n 个,组成一份"重抽样";
  3. 用这份重抽样算一个 Ppk;
  4. 把 2、3 步重复 2 000 ~ 20 000 次,得到一大堆 Ppk;
  5. 把它们排序,取第 2.5% 和第 97.5% 位置的值,就是 95% 经验置信区间。

它的好处是完全不问分布长什么样,缺点是"只能在已有数据里打转"。 原始样本没抓到的尾部,Bootstrap 也变不出来,所以小样本下它的区间会偏窄、偏乐观。实操建议:Bootstrap 结果和解析近似都算一遍,取更保守的那个报给客户。

2.3 样本实在不够时的四条替代路线

三、车间真实案例 / 计算过程

新项目零件,关键尺寸 45.00 ± 0.15 mm(LSL 44.85、USL 45.15,T = 0.30)。试产 30 件,客户要求 Ppk ≥ 1.67

实测统计量:n = 30,x̄ = 45.0050 mm,s = 0.02650 mm

第一步:点估计

上侧:(45.15 − 45.0050)/(3×0.0265) = 0.1450/0.0795 = 1.824 下侧:(45.0050 − 44.85)/(3×0.0265) = 0.1550/0.0795 = 1.950

Ppk = min(1.824, 1.950) = 1.82 ✅ 看着过了

第二步:算标准误

SE = 1.824 × √[ 1/(9×30×1.824²) + 1/(2×29) ] = 1.824 × √(0.0011132 + 0.0172414) = 1.824 × √0.0183546 = 1.824 × 0.13548 = 0.2471

第三步:置信区间

双侧 95%:1.824 ± 1.96 × 0.2471 = (1.34, 2.31) 单侧 95% 下限:1.824 − 1.645 × 0.2471 = 1.42

客户要 1.67,我们的 95% 置信下限只有 1.42。 点估计确实是 1.82,但这份数据不足以在 95% 把握下声称"真值 ≥ 1.67"。客户那位工程师没为难人,他要的东西是对的。

第四步:Bootstrap 验证

对这 30 个原始数据做 20 000 次有放回重抽样,每次算一个 Ppk,排序后取分位数:

分位Ppk
2.5%1.55
5%1.59
50%(中位)1.85
97.5%2.33

Bootstrap 给的 95% 区间是 (1.55, 2.33),比解析法的 (1.34, 2.31) 窄了一截——这正是前面说的"小样本下 Bootstrap 偏乐观"。

两个下限,1.42 和 1.55,都够不到 1.67。 结论一致:这 30 件,证不了。

第五步:那要多少件才够

保持点估计 1.824 不变,反解让单侧 95% 下限刚好达到 1.67 所需的 n:

$$1.824 - 1.645 \times 1.824\sqrt{\frac{1}{9n \times 3.327} + \frac{1}{2(n-1)}} \geq 1.67$$

迭代求解得 n ≥ 204

从 30 件到 204 件,将近 7 倍。 这就是"证明 Ppk ≥ 1.67"的真实价码。

第六步:我们最后怎么谈的

跟客户摊牌,交了这么一套东西:

  1. Ppk 点估计 1.82,95% 置信下限 1.42,明确写清样本量 n=30 的局限
  2. 补做机器能力研究:连续 50 件,Cm = 2.31、Cmk = 2.18,证明设备本身余量充足;
  3. 承诺量产前 3 个月加严 SPC:子组量从 5 提到 8,每周滚动重算 Ppk,累计到 200 件时提交正式能力报告;
  4. PFMEA 里对该特性增加在线量仪 100% 监控,探测度从 6 降到 2。

客户批了有条件 PPAP(Interim Approval),三个月后累计 216 件,Ppk = 1.79,95% 下限 1.68,转正式批准。

没有一个数字是编的,只是把"我知道我不知道什么"讲清楚了。 这在客户那边叫专业,在我们这儿叫少挨骂。

Bootstrap 分布图(本篇主图)。主体是一张 Bootstrap 重抽样得到的 Ppk 直方图(20 000 次),横轴 Ppk 1.2~2.6,形状略右偏;直方图主体填浅蓝,左侧 2.5% 尾部区域填警示红并标 "1.55",右侧 2.5% 尾部填浅灰标 "2.33";在 1.824 处画一条深蓝竖实线标"点估…
图 2 · Bootstrap 分布图(本篇主图)。主体是一张 Bootstrap 重抽样得到的 Ppk 直方图(20 000 次),横轴 Ppk 1.2~2.6,形状略右偏;直方图主体填浅蓝,左侧 2.5% 尾部区域填警示红并标 "1.55",右侧 2.5% 尾部填浅灰标 "2.33";在 1.824 处画一条深蓝竖实线标"点估计",在 1.67 处画一条金橙竖虚线标"客户要求"——**金橙线明显落在红色尾部区域的右边**,直观显示"下限够不到要求"。图下方一行流程小图标:原始 30 点 →〔有放回抽样 ×20000〕→ 直方图 → 取分位数。图注:"点估计只是一个点,决策要看那条尾巴"。

四、常见误区提醒

  1. 拿十来个件算 Cpk 就往报告上写。前面表里写得明明白白,n=10 时点估计 1.33 的置信下限是 0.79。这种报告的信息量约等于零,一旦客户回头查,还落个"数据不实"的口实。样本量低于 25,就别单独用能力指数下结论。
  1. 小样本用 Cpk 而不用 Ppk。样本少的时候,你压根没法把"组内变差"和"组间变差"分清楚,R̄/d₂ 那套估法失去意义。小样本一律用总体样本 s、报 Ppk,这是最基本的诚实。
  1. Bootstrap 抽出来的区间当成金标准。案例里 Bootstrap 区间比解析区间窄了 0.21。Bootstrap 不产生新信息,它只是把已有 30 个点重新洗牌。 用它可以,但要知道它在小样本下偏乐观,最好用 BCa 偏差校正,或者干脆和解析法对照取保守值。
  1. 一看数据不够就找客户要求降低门槛。这是最没出息的一招,而且基本谈不成。正确的谈法是换证据结构:点估计 + 置信下限 + 机器能力 + 加严监控 + 分阶段提交。 客户要的是风险可控,不是那个数字本身好看。

五、小结 & 互动提问

能力指数是个统计估计,它自带一条误差棒。样本少的时候,那条误差棒比指数本身还长——你报一个光秃秃的数字,等于把这条误差棒藏起来了。

小样本不丢人,藏着掖着才丢人。把置信下限一起报出去,把证据链补齐,这才是资深质量工程师和"会用软件点按钮的人"之间的区别。

互动提问:翻出你最近提交的一份 PPAP 能力报告,看看样本量是多少、Ppk 是多少。套一下本文的公式算个 95% 置信下限——它还够得着客户的要求线吗?

如需配套互动练习、培训课件或软件试用,可搜索「东方大易」或访问大易官网 www.eastdayi.com(苏州东方大易管理咨询有限公司,电话 0512-65561989)联系客服获取。

【来源标注】本篇依据:ISO 22514-1《过程能力与性能统计方法 第1部分:通用原理与概念》(能力指数作为统计估计量的性质、报告要求);配合 ISO 22514-2(时间相关模型,用于判断短期数据是否具有代表性)与 ISO 22514-3(机器性能研究,作为小样本的替代证据)一并使用。能力指数置信区间的近似公式与 Bootstrap 方法属于统计学通用方法,并非 ISO 22514 系列的强制规定,报告中应注明所用近似式与重抽样次数。短流程/小批量的标准化处理可参见 GB/T 17989 系列中短程控制图相关内容。可配套互动页:iso-spc-kb/KP301.html(Cp 与 Cpk)、iso-spc-kb/KP302.html(Pp 与 Ppk)、iso-spc-kb/KP305.html(机器能力研究)、iso-spc-tutorials/ISO22514-1_capability_general_guide.html、iso-spc-tutorials/shortrun_control_chart_guide.html、iso-spc-tutorials/ISO22514-9_tr_technical_report.html。
苏州东方大易(大易培训中心)
专业汽车行业标准培训与咨询 · IATF 16949 / APQP / FMEA / SPC / CP / PPAP / VDA 6.3 内审员
官网 www.eastdayi.com | 咨询电话 0512-65561969 / 0512-65561989
相关文章推荐