置信区间:估计的误差声明

04-统计推断 核心 约 20 分钟 #置信区间#置信水平#误差范围#区间估计 更新 2026-10-02
当前状态:未学
本文基于模型知识整理(生成时未联网核对),区间构造与解释建议对照 Wasserman §6.3 复核。

一句话定义

95% 置信区间是"由数据算出的、其构造方法能保证 95% 覆盖的随机区间"——例如均值区间 $\bar x\pm z_{0.975}\cdot s/\sqrt n$;正确的解读是频率性的:"重复此实验多次,约 95% 的这样构造出的区间会罩住真值"(而不是"真值有 95% 概率落在本区间")。

为什么重要

点估计(kp-018)不携带不确定性声明:"转化率 5.2%"与"5.2%±0.4%"的决策价值天差地别。置信区间是频率派推断的交付形态——AB 测试报告、民意调查的 ±3%、论文表格的误差线,全是本条的化身。它与假设检验(kp-021)是一枚硬币的两面:95% 区间 ⟺ 5% 水平下不被拒绝的参数集合。

前置知识

kp-015(CLT/标准误)、kp-017(t 分布)。

核心概念

  • 均值区间(大样本/σ 已知):$\bar x\pm z_{0.975}\frac{\sigma}{\sqrt n}\approx\bar x\pm1.96\,\text{SE}$——三要素:点估计 ± 临界值 × 标准误(kp-015 的 SE 概念)。
  • σ 未知/小样本:用 t 分布临界值 $\bar x\pm t_{0.975,n-1}\,s/\sqrt n$(kp-017 的厚尾补偿)。
  • 比例区间:$p̂\pm z\sqrt{\frac{p̂(1-p̂)}n}$;小样本用 Wilson 区间(更稳)或 Agresti-Coull 校正。
  • 正确的频率解读:区间是随机的(数据变区间变),真值固定——"95%"描述方法的长期覆盖率,不是单次区间的真值概率。贝叶斯的可信区间(kp-022)才允许"参数有 95% 概率在区间内"的解读(同数字、不同哲学,kp-033)。
  • 区间宽度的杠杆:置信水平↑(95→99)→ 更宽;样本量↑ → 按 1/√n 收窄;σ↑ → 更宽(kp-023 的标准误三件套)。
  • 精确定义:$\inf_\theta P_\theta\left(\theta\in[\ell(X),u(X)]\right)\ge0.95$——覆盖概率对一切真 θ 成立(这是"最坏情况的长期覆盖承诺")。

原理与机制

为什么公式成立(对称正态情形三行):$\bar X\sim N(\mu,\sigma^2/n)$ ⇒ $P\left(-z\le\frac{\bar X-\mu}{\text{SE}}\le z\right)=0.95$ ⇒ 括号内解出 μ 得 $[\bar X-z\text{SE},\bar X+z\text{SE}]$——区间随机、μ 固定,覆盖概率=中间正态面积。构造=把"标准化的覆盖陈述"反解成 μ 的不等式。

置信区间与检验的对偶:μ 的 95% 置信区间 = "水平 5% 的双侧检验不被拒绝的所有 μ 值集合"——报告区间即隐式报告了一切水平 5% 的检验结论;"区间含 0(差值)"⇔"差异在 5% 水平不显著"。对偶性让两个工具合并理解。

为什么"本区间罩住真值的概率是 95%"是错误解读:单次实现后,区间两端是固定数字、μ 是固定参数——要么罩住要么没罩住(概率 0 或 1);"95%"属于构造方法的长期频率。想要"参数的概率"语义请转贝叶斯可信区间(kp-022)——两种区间数字可以一样,哲学完全不同。

图示

区间: x̄ ± z_{0.975}·SE ,  SE=σ/√n  (σ未知→t)
解读(正确): 重复实验 → ~95% 的此类区间罩住真值
解读(错误): "真值有95%概率在此区间内" ← 频率派禁止
杠杆: 置信水平↑→宽 ; n↑→窄(1/√n) ; σ↑→宽
对偶: 95%CI = 5%水平不拒绝的 μ 集合 (与检验一体两面)

直观类比

置信区间像"渔网规格检测":渔网(构造方法)经测试能网住 95% 的目标尺寸鱼——你今天打上来的一网(具体区间)要么网住了那条鱼要么没网住,但"这张网"的 95% 是可审计的品质承诺。

实例或案例

  • 民调:n=1067、p̂=52% → ±3%——媒体民调的标准误差条(CLT kp-015 的兑现)。
  • AB 测试:B−A 差值的置信区间 [0.3%, 2.1%] 不含 0 ⇒ 显著且效应方向明确——比单看 p 值信息更足(效应量+不确定性,kp-031 的现代建议)。
  • 医学文献:HR(风险比)的报告必须带 95% CI——区间跨 1(无效线)即不显著,读论文的固定动作。

常见误区

  • 误区一:"真值有 95% 概率在区间内"。频率派禁止(真值固定);此解读属于贝叶斯可信区间(kp-022)——最普遍的统计误读。
  • 误区二:"置信水平越高越好"。99% 区间更宽(信息更少);水平的选择是覆盖与精度的权衡(99% 精度 vs 95% 精度)。
  • 误区三:"区间不覆盖真值=计算错误"。5% 的构造失败率是承诺的一部分;单次未覆盖恰是频率语义的正常兑现。

与其他知识点的关系

  • kp-015/017:SE 与 t/正态临界值的供给。
  • kp-021:对偶关系(区间↔检验)。
  • kp-022:贝叶斯可信区间的哲学对照。

自测题

  1. n=100、x̄=50、s=10:95% 置信区间?

答:50±1.984×1≈[48.0, 52.0](t₉₉≈1.984)。

  1. 为什么 99% 区间比 95% 宽?宽多少(正态近似)?

答:临界值 2.576 vs 1.96——宽约 31%;覆盖换取精度。

  1. 贝叶斯 95% 可信区间与频率 95% 置信区间数字接近时,解读差别是什么?

答:前者可直接说"参数有 95% 概率在其中"(参数随机);后者只能说"方法长期覆盖 95%"(区间随机)——数字同、语义异。

延伸阅读

  • Wasserman《All of Statistics》第 6 章。
  • Morey 等, "The fallacy of placing confidence in confidence intervals"(解读陷阱的专文)。
  • 《统计推断》(Casella & Berger)第 9 章。