统计量与抽样分布:从样本到推断的桥
本文基于模型知识整理(生成时未联网核对),抽样分布推导建议对照 Wasserman §6 或 Casella & Berger 第 5 章复核。
一句话定义
统计量是"样本的函数、不含未知参数"(样本均值 $\bar X$、样本方差 $S^2$);抽样分布是"统计量在重复抽样下的分布"——它是所有推断的通货:置信区间(kp-020)与假设检验(kp-021)的临界值全部来自统计量的抽样分布(正态/t/χ²/F 家族)。
为什么重要
"数据 → 统计量 → 查抽样分布"是频率派推断的完整流水线:不理解抽样分布,p 值与置信区间就只是"背出来的仪式";理解了,你会看到它们都是在问"如果参数真已知,这个统计量会有多常见"(kp-021 的核心句)。三大抽样分布(t/χ²/F)全部由 kp-012 的变换/卷积从正态生成。
前置知识
kp-009(正态)、kp-012(变换与卷积)、kp-015(CLT)。
核心概念
- 统计量:$T=h(X_1,\dots,X_n)$——数据的压缩摘要。$\bar X$(中心)、$S^2=\frac1{n-1}\sum(X_i-\bar X)^2$(散布,除以 n−1 的自由度修正)。
- 正态总体的三大抽样分布(经典三件套):
- $\bar X\sim N(\mu,\sigma^2/n)$(kp-015/013:正态线性自封); - $\frac{(n-1)S^2}{\sigma^2}\sim\chi^2_{n-1}$(平方和→卡方,自由度 n−1——损失一维给 $\bar X$); - $\frac{\bar X-\mu}{S/\sqrt n}\sim t_{n-1}$(正态÷√卡方比,分子分母独立)。
- t 分布:正态加厚尾(自由度→∞ 时退化为正态)——小样本 σ 未知时的"诚实的正态";自由度=可自由变动的信息量。
- F 分布:两个独立卡方除以各自自由度之比——方差比较(ANOVA kp-033 延伸)的检验统计量。
- 经验教训:非正态总体时 $\bar X$ 的抽样分布由 CLT 近似正态(大 n,kp-015),但 $S^2$ 的卡方结论不再严格成立(对离群敏感)。
原理与机制
为什么除以 n−1(自由度):$\sum(X_i-\bar X)^2$ 的 n 个偏差被"均值约束"吃掉一个自由维度(知道 n−1 个即确定第 n 个);除以 n−1 使 $E[S^2]=\sigma^2$(无偏,kp-019)。自由度=独立信息量是贯穿检验与区间的一根主线。
三大分布的生成系谱(kp-012 的流水线):标准正态平方和 → χ²($Z^2\sim\chi^2_1$,卷积/MGF 加法 kp-013);正态除以 √(χ²/自由度) → t(厚尾来自分母的随机性——σ 的估计不确定性被计入);χ² 比值 → F。全部家族成员都是"标准正态"的组装品——这也是 kp-009 正态"统治统计"的机制层。
为什么抽样分布是"推断的通货":检验的 p 值=统计量在 H₀ 抽样分布中的尾部面积(kp-021);置信区间的临界值=抽样分布的分位数(kp-020)——没有抽样分布,这两者都无从谈起。
图示
统计量: T=h(样本) 不含未知参数
正态总体三件套:
X̄ ~ N(μ, σ²/n)
(n−1)S²/σ² ~ χ²_{n−1} (自由度=n−1)
(X̄−μ)/(S/√n) ~ t_{n−1} (厚尾→∞退化为正态)
系谱: Z² → χ² ; Z/√(χ²/ν) → t ; χ²比 → F
非正态: X̄ 靠 CLT 近似, S² 结论需谨慎
直观类比
统计量像"体检指标"(血压均值、血糖波动);抽样分布像"健康人群里这个指标的分布曲线"——你的指标落在曲线哪一段(常见/罕见),决定了医生说"正常"还是"异常"。t/χ²/F 就是不同体检项目的"人群参考曲线家族"。
实例或案例
- 小样本均值检验:n=10 的生产件均值检测——σ 未知时用 t 分布而非正态(尾部更厚=更诚实的宽容)。
- 方差质检:两台机器精度比较——F 检验比较两个 $S^2$(kp-021 的方差版检验)。
- 模拟体验:
np.random反复抽样画 $\bar X$ 直方图——亲眼看见抽样分布成形(kp-032 工作流的入门实验)。
常见误区
- 误区一:"抽样分布=样本的分布"。它是统计量跨次重复抽样的分布;同一次数据上没有分布可言(频率派语义,kp-021)。
- 误区二:"t 与正态随便互换"。小样本 t 尾更厚——用正态会高估显著性(kp-021 的错误源)。
- 误区三:"自由度是数字游戏"。n−1 与 n 的选择直接影响 S² 无偏性与检验临界值;自由度的会计是检验正确性的隐性账本。
与其他知识点的关系
自测题
- 为什么 $S^2$ 除以 n−1 而不是 n?
答:$\bar X$ 已用掉一个自由度,残差平方和自由度 n−1;除以 n−1 使 E[S²]=σ²(无偏)。
- t 分布何时退化为正态?
答:自由度→∞(σ 已知或 n 很大时 S→σ,比值收敛到标准正态)。
- 非正态小样本能用 t 检验吗?
答:t 的精确推导失效;靠 CLT 近似或非参数方法(秩检验)——先看分布再选工具(kp-030 精神)。
延伸阅读
- Wasserman《All of Statistics》第 6 章。
- Casella & Berger《Statistical Inference》第 5 章(抽样分布的严格推导)。
- Student(W.S. Gosset)1908 年 t 分布原始论文(工业质量背景的历史趣读,kp-033)。