中心极限定理:正态的普适性
本文基于模型知识整理(生成时未联网核对),条件与误差阶建议对照 Durrett 或 Wasserman §5.3 复核。
一句话定义
中心极限定理(CLT):独立同分布、方差有限的随机变量之和(或样本均值)在 n 大时近似正态——$\bar X_n\approx N(\mu,\sigma^2/n)$,等价地 $\frac{\bar X_n-\mu}{\sigma/\sqrt n}\xrightarrow{d}N(0,1)$。无论个体是什么分布,大量相加后都长成钟形——正态分布统治统计的根本原因。
为什么重要
它是统计推断的发动机:置信区间(kp-020)、假设检验(kp-021)、AB 实验分析全部建立在"样本均值近似正态"上;测量误差、生物变异、民意调查的钟形现象都由它解释。可以说:LLN 告诉你均值会到 μ(kp-014),CLT 告诉你"怎么没到"(波动形态)——两个定理合起来才是完整的长程行为理论。
前置知识
kp-007(期望方差)、kp-009(正态分布)、kp-014(LLN)。
核心概念
- 经典 CLT:$X_1,\dots,X_n$ i.i.d.、均值 μ、方差 σ²<∞ ⇒
$$Z_n=\frac{\bar X_n-\mu}{\sigma/\sqrt n}\xrightarrow{d}N(0,1)\quad(n\to\infty)$$ (依分布收敛)。
- 标准误(SE):$\sigma/\sqrt n$——样本均值的标准差,"均值估计的天然精度";它随 √n 衰减(精度翻倍要 4 倍样本!)。
- 实践形态:$\bar X_n\approx N(\mu,\sigma^2/n)$;σ 未知时用样本标准差 s 代替(大 n 下无害,小 n 转入 t 分布 kp-017)。
- 二项的正态近似:Bin(n,p) ≈ N(np, np(1−p))(np、n(1−p) 都 ≥5~10 时够用;连续性校正 ±0.5 提升精度)——kp-008 桥接 kp-021。
- 常见经验阈值:n≥30 常被引用(粗糙);真正的门槛看分布形状——对称/轻尾可更小、重尾需更大甚至失效(kp-030 的边界专篇)。
原理与机制
为什么是正态(MGF 视角一行):标准化部分和的 MGF 展开为 $(1+\frac{t^2\sigma^2+o(t^2)}{n})^{n/2}\to e^{t^2/2}$——N(0,1) 的 MGF(kp-013 的生成函数引擎)。一阶项被中心化消掉、二阶项幸存、高阶被 n 除掉——正态是"只剩二阶"的极限形态,这就是"任何分布的和殊途同归于钟形"的代数机制。
为什么是 √n 而不是 n:n 个独立波动相加,方差 σ² 相加得 nσ²(kp-007 独立可加),标准差 σ√n——波动按 √n 增长而均值按 n 增长,相除得 σ/√n。"精度翻倍要四倍样本"的工业定律由此而来(蒙特卡洛 kp-026 同款)。
CLT 与 LLN 的分工:LLN 说 $\bar X_n\to\mu$(波动消失);CLT 量化"消失得多快"——波动幅度 √n·(X̄ₙ−μ) 不消失而收敛到正态。LLN 是方向,CLT 是速度计;置信区间(kp-020)= CLT 速度计的直接产品。
图示
X̄ₙ ≈ N(μ, σ²/n) ; Zₙ=(X̄ₙ−μ)/(σ/√n) →d N(0,1)
标准误 SE = σ/√n (精度∝√n: 翻倍精度=4倍样本)
二项近似: Bin(n,p)≈N(np,np(1−p)) (n·p 均够大 + 连续性校正)
经验: n≥30 起步 ; 对称轻尾可小 ; 重尾失效 (kp-030)
LLN 给方向(→μ), CLT 给速度(波动=σ/√n)
直观类比
亿万人各掷一枚硬币:单次结果五花八门,但"正面比例"的分布随人数增长收紧成钟形(宽度 ∝1/√n)——CLT 说不管每个人的硬币多古怪(只要方差有限),比例的集体行为都会标准化成同一座钟。这就是"个体混沌、集体规律"的精确含义。
实例或案例
- 民调 ±3%:n≈1000 时 SE=√(0.25/1000)≈1.6%,95% 区间 ±3%——CLT 的每日新闻形态(kp-020 置信区间的构造材料)。
- AB 实验:两转化率之差的检验统计量在 H₀ 下近似正态——z 检验的全部依据(kp-021)。
- 物理测量:多次读数取平均并报 ±标准误——测量学的 CLT 化。
常见误区
- 误区一:"原始数据要正态才能用 CLT"。恰恰相反——个体任意(方差有限即可),收敛的是样本均值;把 CLT 误读为"数据分布变正态"是根本性错误(kp-030)。
- 误区二:"n 大就无限近似"。重尾(方差不存在如柯西)CLT 前提破坏;强偏斜小样本下近似差(需要更多 n 或换方法)。
- 误区三:"CLT 保证单次样本 behaved"。CLT 是分布级陈述;对特定一次抽样没有保证——它校准的是"长期使用此方法的频率"。
与其他知识点的关系
自测题
- X̄ₙ 来自 Var=16 的分布,n=100:SE 多少?P(|X̄ₙ−μ|>1)≈?
答:SE=0.4;正态近似 P(|Z|>2.5)≈1.2%。
- 为什么精度翻倍要 4 倍样本?
答:SE∝1/√n——SE 减半需 n 增 4 倍(平方关系)。
- 掷骰子 100 次求点数总和的近似分布。
答:单次 μ=3.5、σ²=35/12;总和 ≈ N(350, 3500/12)——个体离散、总和正态(CLT 实战)。
延伸阅读
- Blitzstein & Hwang 第 10 章(LLN/CLT 双章)。
- Wasserman《All of Statistics》§5.3–5.4。
- Schervish《Theory of Statistics》CLT 严格条件(进阶)。