两比例检验实战:如何判断改善前后的不良率差异是否真实

制造现场经常出现这样的结论:“改善后不良率从 3.0% 降到 2.2%,方案有效。”但两个百分比不同,并不等于总体过程真的不同。抽样波动本身就可能造成差异;反过来,样本太少也可能掩盖有实际意义的改善。两比例检验(two-proportions test)正是用来区分“看起来不同”和“有统计证据支持的不同”。

一、两比例检验是什么

两比例检验用于比较两个独立总体中某一二元事件的发生比例。例如:两条产线的不良率、改善前后的报废率、两个供应商的来料不合格率,或两种检验方法的检出率。每个观察值必须能明确归入“事件/非事件”两类,例如不良/良品。

设第一组样本量为 n1,事件数为 x1;第二组为 n2 与 x2。样本比例为:

p̂1=x1/n1,p̂2=x2/n2

典型双侧假设是 H0:p1−p2=0;H1:p1−p2≠0。若业务问题预先明确为“改善是否降低不良率”,也可采用单侧备择假设 p2<p1,但方向必须在看数据之前确定,不能为了得到显著结果而事后改成单侧。

二、统计基础与判定逻辑

当零假设为两总体比例相等时,可使用合并比例:

p̂=(x1+x2)/(n1+n2)

大样本正态近似的检验统计量为:

z=(p̂1−p̂2)/√[p̂(1−p̂)(1/n1+1/n2)]

在显著性水平 α=0.05 的双侧检验中,若 P 值小于 0.05,则拒绝 H0;否则只能说“证据不足以认定比例不同”,不能宣布两者相同。P 值回答的是:在零假设成立时,观察到当前或更极端差异的概率;它不是零假设为真的概率,也不衡量改善的经济价值。

除 P 值外,应报告比例差 p̂1−p̂2及其置信区间。常见 Wald 区间为:

(p̂1−p̂2) ± z1−α/2√[p̂1(1−p̂1)/n1 + p̂2(1−p̂2)/n2]

不过 Wald 区间在小样本或比例接近 0、1 时覆盖率可能偏差。NIST 的资料列出了 adjusted Wald(Agresti–Caffo)等改进方法;实际工作宜直接使用经过验证的统计软件,并在报告中注明方法。

三、什么时候不能直接使用普通两比例检验

  • 样本不独立:同一批零件由两种检测法重复判定,或同一对象改善前后配对观察,应考虑 McNemar 检验,而不是把两组当作独立样本。
  • 稀有事件或样本很小:若某组事件数或非事件数很少,正态近似可能不可靠。Minitab 在任一组事件或非事件少于 5 时会给出提示;Fisher 精确检验对所有样本量有效,但可能较保守。
  • 存在混杂:若改善前后产品组合、班次、原料批次或检验标准同时改变,显著差异不一定由改善措施导致,应分层、随机化或用回归模型控制混杂因素。
  • 数据是连续量:尺寸、强度、时间等连续指标不应先随意二分;二分会损失信息,应优先分析原始连续数据。

四、制造业案例:焊点不良率是否真正下降

某电子装配线导入新的回流焊温度参数。改善前随机抽检 1,200 个焊点,发现 42 个不良,p̂1=3.50%;改善后抽检 1,500 个,发现 30 个不良,p̂2=2.00%。观察到的绝对下降为 1.50 个百分点,相对下降约 42.9%。

在 H0:p1=p2 下,合并比例为 72/2700≈2.667%。代入公式可得 z≈2.40,双侧 P 值约 0.016。按 α=0.05,数据支持改善前后总体不良率存在差异。

使用未合并标准误的 95% Wald 置信区间,比例差约为 0.28% 至 2.72%。区间未跨越 0,与显著性判断一致;同时它揭示了效果大小的不确定性。管理者还需把区间转换为业务影响:若月产量为 100 万焊点,按点估计约少 15,000 个不良点,但成本收益评估不应把点估计当成确定值,应结合区间、返修成本与后续验证。

五、实施步骤

  1. 定义事件与分析单位。明确“不良”的判定标准,决定以零件、焊点、批次还是订单作为独立单位,避免把同一件产品上的多个高度相关缺陷当成独立样本。
  2. 形成可比样本。保持抽样时间、产品族、检验设备与检验人员尽量一致;若无法一致,预先设计分层分析。
  3. 写出假设与实际差异门槛。除 α 外,定义最小实际重要差异 Δ,例如至少下降 0.5 个百分点才值得推广。
  4. 事前规划样本量。样本量应同时考虑基准不良率、Δ、显著性水平与检验功效 1−β。仅凭“抽 30 件”通常不足以发现低不良率过程中的小幅改善。
  5. 选择方法。独立大样本可用正态近似;小样本或稀疏数据考虑 Fisher 精确检验;配对二元数据使用 McNemar 检验。
  6. 同时报告统计与业务结论。至少列出各组 n、事件数、样本比例、比例差、置信区间、P 值、检验方向与方法。
  7. 验证可持续性。一次显著结果不代表过程长期受控。推广后还需用 p 图或其他适合属性数据的控制图监测时间序列。

六、常见误区

  • 只比较百分比:3.0% 与 2.2% 的差异是否可信取决于分母,不能忽略样本量。
  • P>0.05 就说“完全一样”:这可能只是检验功效不足。应查看置信区间是否仍包含无法接受的差异。
  • P<0.05 就立即全面推广:统计显著不等于经济显著,还要评估节拍、成本、安全和副作用。
  • 连续试验直到显著:反复查看并随意停止会抬高假阳性风险。应事前确定样本量与停止规则。
  • 忽略检验系统:若缺陷判定的一致性差,两比例检验只会精确分析不可靠数据。属性测量系统分析应先证明判定可重复、可再现。

七、延伸阅读

结语

两比例检验不是把两个百分比送进软件后读取 P 值,而是一套从定义事件、保证样本可比,到量化差异、评估不确定性和业务价值的决策流程。真正稳健的质量结论,应同时回答三个问题:差异是否可能只是随机波动、差异有多大、差异是否值得采取行动。把置信区间、检验功效与过程监控纳入分析,才能让“不良率下降”成为可验证、可复制的改善证据。