p 值争论与统计实践伦理
本文基于模型知识整理(生成时未联网核对),ASA 声明原文(Wasserstein & Lazar 2016)与 Ioannidis 2005 建议检索复核。
一句话定义
p 值的语义在 kp-021 已严格定义,本条处理它的社会性危机:p<0.05 成为发表门票后,选择性报告、多次尝试、预调分析(p-hacking)把"5% 假阳率"的承诺变成了"过半发表结论可能是假"的复现危机——ASA 六原则、预注册、效应量报告、贝叶斯/区间替代是学界开出的处方。
为什么重要
复现危机(心理学/医学大规模复现失败)动摇的是"科学结论的可信基础设施"——而危机的数学核心恰恰是本库已学的知识:多重比较(kp-002 连乘)、基率(kp-004 贝叶斯:先验低时 p<0.05 的后验可信度惊人地低)、功效(kp-021)。学会这节课,你既是更好的研究者,也是更清醒的读者。
前置知识
核心概念
- ASA 六原则(2016,美国统计学会史上首次就单一方法发表声明):
1. p 值度量"数据与特定统计模型的不兼容程度"; 2. p 值不度量假设为真的概率、不度量效应大小; 3. 科学结论与决策不应仅基于 p 值是否过阈; 4. 正确推断需要完整报告与分析透明; 5. p 值不度量效应大小/结果重要性; 6. p 值本身不是模型/假设好坏的充分证据。
- 贝叶斯视角下的"p<0.05 有多可信"(Ioannidis 数值版):设领域内真效应先验仅 10%、功效 80%:
$$P(\text{真}|\text{显著})=\frac{0.8×0.1}{0.8×0.1+0.05×0.9}≈64\%$$ ——"显著"结论有三分之一是假的;若研究者做了多次分析(选择性报告),可信度进一步崩塌。基率忽视的科研版(kp-004/029 的完整闭环)。
- p-hacking 的形态清单:试到显著为止(多重检验 kp-021)、事后挑亚组、灵活剔除离群点、结果出来后编假设(HARKing)、只发阳性结果(发表偏倚/文件抽屉问题)。
- 处方清单:
- 预注册:分析方案在看数据前公开注册(锁死"自由度"); - 效应量+置信区间同报(kp-020:区间比 p 值信息多一个维度); - 多重比较校正(FDR/Bonferroni kp-021); - 功效分析事前(kp-021); - 复现/独立验证作为结论的最终裁判; - 贝叶斯因子/区间估计作为替代或补充叙事(kp-022)。
- 深度澄清:"p 值死了"是标题党——ASA 声明批评的是把 p 值当唯一裁决的实践,不是 p 值本身;正确使用的 p 值仍是证据语言的一部分。
原理与机制
为什么 0.05 阈值在低基率领域失效(贝叶斯算术):检验的"阳性预测价值"取决于基率(kp-004 的直接移植)——探索性领域(真效应先验低)中即使检验完美执行,显著结论的假阳占比仍高;加上研究者自由度(每次"尝试"是一次额外检验),实际假阳率远超名义 α。名义 α 是单次检验的承诺,不是研究结论的可信度。
为什么预注册有效:p-hacking 的数学本质=研究者自由度等效于多次检验(kp-021 的 1−(1−α)^m);预注册把 m 锁回 1——用制度把"选择性"从流程中移除。开放数据/代码则让 m 可审计。
为什么"效应量+区间"优于裸 p 值:p 值把"效应有多大"压缩成"是否过线"的二元位;CI 同时给出大小与不确定性(kp-020)——决策需要的是效应量(值不值得上线),不是显著性徽章。
图示
ASA: p≠P(H₀真) ; p≠效应大小 ; 结论≠仅凭p
贝叶斯体检: P(真|显著) = 功效×基率 / (功效×基率 + α×(1−基率))
基率10%,功效80%,α5% → ≈64% (基率忽视的科学版)
p-hacking: 多次尝试 | 亚组挑选 | HARKing | 发表偏倚
处方: 预注册 | 效应量+CI | 多重校正 | 事前功效 | 复现
直观类比
p<0.05 像"一次安检报警":单次报警在低威胁环境(基率低)下大概率是误报(kp-004 的金属探测器);p-hacking 则像"反复过安检直到某次报警"然后宣称"此人危险"——流程的重复使用彻底摧毁了单次的可信度承诺。
实例或案例
- 心理学复现项目(2015):100 项研究仅 ~39% 复现出显著——选择性与低功效的集体账单。
- 医学文献:效应量随时间缩水的"赢家诅咒"现象(初始显著效应在后续大样本中缩水)——kp-021 低功效夸大效应的纵贯证据。
- 正面案例:基因组学强制 FDR 校正+独立队列验证——高维多重比较的纪律化范本。
常见误区
- 误区一:"复现危机=统计方法错了"。方法是数学正确的(kp-021 内部逻辑无误);错在使用制度(选择性、激励、透明度)——药好,服法错误。
- 误区二:"转用贝叶斯就免疫"。贝叶斯同样可被 hack(先验/模型挑选、后验阈值化)——透明与预注册是对所有范式的通用处方。
- 误区三:"ASA 说 p 值无用"。声明说的是"不是充分证据";与效应量/CI/复现组合的 p 值仍是合法证据语言之一。
与其他知识点的关系
自测题
- 用贝叶斯公式计算:基率 5%、功效 50%(低功效研究)、α=5% 下显著结论的可信度。
答:$\frac{0.5×0.05}{0.5×0.05+0.05×0.95}≈34.5\%$——低功效让"显著"的可信度跌到三分之一。
- 列出三种 p-hacking 形态与对应处方。
答:多次尝试→预注册+多重校正;事后亚组→分层方案预注册;只发阳性→注册报告/期刊要求发表 regardless。
- 为什么"报告 CI 而非裸 p 值"是改进?
答:CI 同时给出效应量与不确定性(kp-020),支持决策与元分析;p 值只压缩成"过/不过阈值"的一个比特。
延伸阅读
- Wasserstein & Lazar. "The ASA's Statement on p-values". The American Statistician, 2016.
- Ioannidis. "Why Most Published Research Findings Are False". PLoS Medicine, 2005.
- Gelman & Stern. "The Difference Between 'Significant' and 'Not Significant' is Not Itself Statistically Significant".(阈值思维的批判经典)