假设检验与 p 值:反证法的统计版

04-统计推断 核心 约 30 分钟 #假设检验#p值#显著性#第一类错误#统计功效 更新 2026-10-02
当前状态:未学
本文基于模型知识整理(生成时未联网核对),检验逻辑与误用清单建议对照 Wasserman §10、ASA 声明(kp-031)复核。

一句话定义

假设检验是"统计反证法":先立零假设 H₀(通常=无效应),在 H₀ 下计算数据的极端程度 p 值(P(观察到如此极端的数据 | H₀ 真)),p < α(如 0.05)则拒绝 H₀——注意 p 值是"假设为真时数据的罕见度",不是"假设为真的概率";四种结局(两类错误与功效)构成检验的完整会计。

为什么重要

科学文献的每一张表格背后都是假设检验:药物、算法对比、AB 实验。同时它是被误用最严重的统计工具(p-hacking、把 p<0.05 当真理印章、忽略功效)——学会正确的检验语义与流程,既是读文献的解码器,也是 kp-031 统计伦理的入场券。

前置知识

kp-015/017(抽样分布)、kp-020(对偶的区间视角)。

核心概念

  • H₀ 与 H₁:零假设(默认/无效应/平等)vs 备择假设(想证明的效应);"证据不足拒绝 H₀" ≠ "证明 H₀ 为真"(只是没抓到把柄)。
  • 检验统计量与 p 值:如 z 检验 $Z=\frac{\bar x-\mu_0}{s/\sqrt n}$;p 值 = H₀ 下该统计量及更极端值的概率——p 是数据的属性(给定 H₀),不是假设的概率。
  • 两类错误:

- 第一类 α:H₀ 真却拒绝(假阳性)——显著性水平就是预设的 α 上限; - 第二类 β:H₁ 真却未拒绝(假阴性);功效=1−β(抓到真实效应的能力)。

  • 功效三要素:效应量越大、样本量越大、α 越大 → 功效越高;低功效+显著=夸大效应(winner's curse,显著结果的效应量系统性虚高)。
  • 检验家族:z/t(均值)、χ²(比例/拟合/独立 kp-017)、F(方差/ANOVA)、非参数(秩检验,分布自由)。
  • 多重比较问题:同时做 m 个检验,至少一个假阳的概率 1−(1−α)^m 飙升 → Bonferroni/FDR 校正——p-hacking 的制度性防线(kp-031)。

原理与机制

为什么是"反证法"而证明不了 H₁:逻辑是"若 H₀ 真,数据如此极端的概率仅 0.03——罕见到值得怀疑 H₀";但这只是削弱 H₀,并未给 H₁ 的概率赋值(那是贝叶斯 kp-022 的领域)。频率派检验只能"拒绝",不能"接受"——"接受 H₀"应表述为"未能拒绝"。

p 值的正确读法三件套:① 在 H₀ 为真时,未来重复实验得到如此极端数据的频率;② 不是效应大小的度量(显著≠重要——大样本下微小效应也显著,效应量另报 kp-020);③ 不是 H₀ 为真的概率(方向反了)。

为什么需要功效分析(事前):样本不足时真效应也大概率测不出(β 高);且"碰巧显著"的实验效应量被选择偏差抬高。事前功效分析定样本量:给定效应量/α/功效 → 反解 n——AB 平台的标准配置步骤。

图示

流程: H₀/H₁ → 检验统计量 → p 值 → 与 α 比较 → 结论
p 值 = P(数据如此极端 | H₀真)   (数据的属性!)
 ≠ P(H₀|数据)   (方向反了 — 贝叶斯才给 kp-022)
错误矩阵:  拒H₀      不拒
 H₀真      α(假阳)   ✓
 H₁真      功效1−β   β(假阴)
多重检验: 1−(1−α)^m → Bonferroni/FDR
显著性 ≠ 重要: 效应量+CI 必须同报 (kp-020/031)

直观类比

假设检验像"药物法庭":H₀=被告无辜;p 值="若无辜,出现这些证据的概率";p 极低 ⇒ "无辜假设难以解释证据" ⇒ 判有罪(拒绝无辜)。但"证据在无辜者身上也可能出现"(5% 假阳)——判决从不等于"无辜概率只剩 5%"(那是贝叶斯 kp-022 的事)。

实例或案例

  • AB 实验:转化率 A=5.0%、B=5.8%、n=各 10000 → z≈2.4、p≈0.016 → 拒绝"无差异";同时报告差值 CI [0.15%, 1.45%](kp-020 的对偶)。
  • 多臂实验陷阱:20 个指标里挑最显著的报——p 值被"挑选"污染(kp-031 的 p-hacking 案例)。
  • 单侧 vs 双侧:只关心"B>A"用单侧(同数据 p 减半)——方向假设必须在看数据前注册(预注册制度 kp-031)。

常见误区

  • 误区一:"p=0.049 显著、p=0.051 不显著——本质不同"。p 是连续量;阈值是约定(且 α=0.05 只是社区惯例 kp-031),0.001 与 0.049 都是"中等证据"。
  • 误区二:"不显著=证明无差异"。功效不足同样产生不显著;"证据不足"≠"证据证明不存在"。
  • 误区三:"p<0.05 就是真效应"。单次检验 5% 假阳率 × 多重尝试 + 低功效夸大——显显著结果的后验可信度远低于直觉(可用 kp-022 的贝叶斯公式量化:先验低时假阳主导)。

与其他知识点的关系

  • kp-017/020:统计量与对偶区间。
  • kp-004/022:贝叶斯给出"假设概率"的正确语言。
  • kp-031:p-hacking、ASA 六原则、预注册与统计伦理的完整讨论。

自测题

  1. 用一句话向产品经理解释 p=0.03。

答:假如两版真的无差异,出现"数据差异如此之大"的概率约为 3%——这是对无差异假设的怀疑度,不是 B 优于 A 的概率。

  1. α=0.05 做 10 个独立检验:至少一个假阳的概率?

答:1−0.95¹⁰≈40%——多重校正的必要性演示。

  1. 效应量很大但 p=0.08(n 小),下一步?

答:报告效应量+CI,说明功效不足;扩样本复测——而非宣布"无效应"或硬抠显著。

延伸阅读

  • Wasserstein & Lazar, "The ASA's Statement on p-values"(2016,kp-031 原文)。
  • Wasserman《All of Statistics》第 10 章。
  • 《统计学关我什么事》(Kranzler,漫画式入门)。