假设检验与 p 值:反证法的统计版
本文基于模型知识整理(生成时未联网核对),检验逻辑与误用清单建议对照 Wasserman §10、ASA 声明(kp-031)复核。
一句话定义
假设检验是"统计反证法":先立零假设 H₀(通常=无效应),在 H₀ 下计算数据的极端程度 p 值(P(观察到如此极端的数据 | H₀ 真)),p < α(如 0.05)则拒绝 H₀——注意 p 值是"假设为真时数据的罕见度",不是"假设为真的概率";四种结局(两类错误与功效)构成检验的完整会计。
为什么重要
科学文献的每一张表格背后都是假设检验:药物、算法对比、AB 实验。同时它是被误用最严重的统计工具(p-hacking、把 p<0.05 当真理印章、忽略功效)——学会正确的检验语义与流程,既是读文献的解码器,也是 kp-031 统计伦理的入场券。
前置知识
kp-015/017(抽样分布)、kp-020(对偶的区间视角)。
核心概念
- H₀ 与 H₁:零假设(默认/无效应/平等)vs 备择假设(想证明的效应);"证据不足拒绝 H₀" ≠ "证明 H₀ 为真"(只是没抓到把柄)。
- 检验统计量与 p 值:如 z 检验 $Z=\frac{\bar x-\mu_0}{s/\sqrt n}$;p 值 = H₀ 下该统计量及更极端值的概率——p 是数据的属性(给定 H₀),不是假设的概率。
- 两类错误:
- 第一类 α:H₀ 真却拒绝(假阳性)——显著性水平就是预设的 α 上限; - 第二类 β:H₁ 真却未拒绝(假阴性);功效=1−β(抓到真实效应的能力)。
- 功效三要素:效应量越大、样本量越大、α 越大 → 功效越高;低功效+显著=夸大效应(winner's curse,显著结果的效应量系统性虚高)。
- 检验家族:z/t(均值)、χ²(比例/拟合/独立 kp-017)、F(方差/ANOVA)、非参数(秩检验,分布自由)。
- 多重比较问题:同时做 m 个检验,至少一个假阳的概率 1−(1−α)^m 飙升 → Bonferroni/FDR 校正——p-hacking 的制度性防线(kp-031)。
原理与机制
为什么是"反证法"而证明不了 H₁:逻辑是"若 H₀ 真,数据如此极端的概率仅 0.03——罕见到值得怀疑 H₀";但这只是削弱 H₀,并未给 H₁ 的概率赋值(那是贝叶斯 kp-022 的领域)。频率派检验只能"拒绝",不能"接受"——"接受 H₀"应表述为"未能拒绝"。
p 值的正确读法三件套:① 在 H₀ 为真时,未来重复实验得到如此极端数据的频率;② 不是效应大小的度量(显著≠重要——大样本下微小效应也显著,效应量另报 kp-020);③ 不是 H₀ 为真的概率(方向反了)。
为什么需要功效分析(事前):样本不足时真效应也大概率测不出(β 高);且"碰巧显著"的实验效应量被选择偏差抬高。事前功效分析定样本量:给定效应量/α/功效 → 反解 n——AB 平台的标准配置步骤。
图示
流程: H₀/H₁ → 检验统计量 → p 值 → 与 α 比较 → 结论
p 值 = P(数据如此极端 | H₀真) (数据的属性!)
≠ P(H₀|数据) (方向反了 — 贝叶斯才给 kp-022)
错误矩阵: 拒H₀ 不拒
H₀真 α(假阳) ✓
H₁真 功效1−β β(假阴)
多重检验: 1−(1−α)^m → Bonferroni/FDR
显著性 ≠ 重要: 效应量+CI 必须同报 (kp-020/031)
直观类比
假设检验像"药物法庭":H₀=被告无辜;p 值="若无辜,出现这些证据的概率";p 极低 ⇒ "无辜假设难以解释证据" ⇒ 判有罪(拒绝无辜)。但"证据在无辜者身上也可能出现"(5% 假阳)——判决从不等于"无辜概率只剩 5%"(那是贝叶斯 kp-022 的事)。
实例或案例
- AB 实验:转化率 A=5.0%、B=5.8%、n=各 10000 → z≈2.4、p≈0.016 → 拒绝"无差异";同时报告差值 CI [0.15%, 1.45%](kp-020 的对偶)。
- 多臂实验陷阱:20 个指标里挑最显著的报——p 值被"挑选"污染(kp-031 的 p-hacking 案例)。
- 单侧 vs 双侧:只关心"B>A"用单侧(同数据 p 减半)——方向假设必须在看数据前注册(预注册制度 kp-031)。
常见误区
- 误区一:"p=0.049 显著、p=0.051 不显著——本质不同"。p 是连续量;阈值是约定(且 α=0.05 只是社区惯例 kp-031),0.001 与 0.049 都是"中等证据"。
- 误区二:"不显著=证明无差异"。功效不足同样产生不显著;"证据不足"≠"证据证明不存在"。
- 误区三:"p<0.05 就是真效应"。单次检验 5% 假阳率 × 多重尝试 + 低功效夸大——显显著结果的后验可信度远低于直觉(可用 kp-022 的贝叶斯公式量化:先验低时假阳主导)。
与其他知识点的关系
自测题
- 用一句话向产品经理解释 p=0.03。
答:假如两版真的无差异,出现"数据差异如此之大"的概率约为 3%——这是对无差异假设的怀疑度,不是 B 优于 A 的概率。
- α=0.05 做 10 个独立检验:至少一个假阳的概率?
答:1−0.95¹⁰≈40%——多重校正的必要性演示。
- 效应量很大但 p=0.08(n 小),下一步?
答:报告效应量+CI,说明功效不足;扩样本复测——而非宣布"无效应"或硬抠显著。
延伸阅读
- Wasserstein & Lazar, "The ASA's Statement on p-values"(2016,kp-031 原文)。
- Wasserman《All of Statistics》第 10 章。
- 《统计学关我什么事》(Kranzler,漫画式入门)。