估计量的评价:偏差、方差与一致性
本文基于模型知识整理(生成时未联网核对),MSE 分解与 Cramér-Rao 建议对照 Wasserman §9.3 复核。
一句话定义
评价一个估计量 $\hat\theta$ 的三问:偏差 $E[\hat\theta]-\theta$ 是否为零(瞄准准不准);方差 $\text{Var}(\hat\theta)$ 大不大(瞄准稳不稳);一致性 n→∞ 时是否收敛到真值(练得多必不练得差?);综合指标是均方误差 $\text{MSE}=\text{Var}+(\text{Bias})^2$——偏差与方差可以互换,总误差才是硬通货。
为什么重要
同一参数有无数候选估计(样本均值/中位数/加权/收缩估计……),没有评价体系就无法选择。MSE 分解更是机器学习的元定理:正则化(kp-030 的岭回归思路)、模型选择、偏差-方差权衡(欠拟合/过拟合)——全部是"牺牲一点偏差换方差大降"的同一剧本。
前置知识
kp-007(期望方差)、kp-018(MLE 作为候选估计)。
核心概念
- 无偏:$E[\hat\theta]=\theta$;例:x̄ 无偏估计 μ;$S^2$(除 n−1)无偏估计 σ²(除 n 的版本有偏,kp-017)。
- 一致性:$\hat\theta_n\xrightarrow{P}\theta$(依概率收敛,kp-014 语言);MLE 渐近一致(kp-018)。
- MSE 分解:$\text{MSE}(\hat\theta)=E[(\hat\theta-\theta)^2]=\text{Var}(\hat\theta)+(\text{Bias})^2$——恒等式。
- 有效性与 Cramér-Rao 下界:无偏估计量的方差有下界 $\frac{1}{nI(\theta)}$(I 为 Fisher 信息 kp-013);达到下界=有效(MLE 渐近达到)。
- 偏差-方差权衡的经典案例:方差估计 $\hat\sigma^2=\frac1n\sum(x-\bar x)^2$(有偏、Var 小)vs $\frac1{n-1}$(无偏、Var 略大)——回归里通常选 MSE 更小的有偏版。
- 渐进视角:一致性是底线(大样本必须对),无偏/有效是小样本品质(样本少时讲究)。
原理与机制
为什么无偏不是最高纲领:无偏但方差爆炸的估计(如"永远输出均值之外的高方差摆动")总误差惨烈;岭回归/收缩估计故意引入偏差换取方差大降——MSE 判据下有偏估计常胜出。" unbiased" 是历史光环,MSE 才是现代标准(James-Stein 现象:三维以上常数的收缩估计全面压制无偏估计——统计学的惊天案例)。
Cramér-Rao 下界的意义:Fisher 信息 I(θ)(kp-013 矩母的邻居)度量"数据携带参数信息的密度"——信息越多下界越低(估计越准的可能上限);MLE 渐近触底说明"在渐近意义上无可再准"(kp-018 的有效证书)。
一致性为什么是底线:不一致意味着数据越多越错(系统性迷失)——任何小样本优点都无法赎回;工程检查第一问永远是"n→∞ 时对不对"。
图示
Bias: E[θ̂] − θ (瞄准偏差)
Var(θ̂): 瞄准抖动
MSE = Var + Bias² (总误差恒等式)
一致: θ̂ₙ →P θ (底线)
Cramér-Rao: Var ≥ 1/(nI(θ)) (有效性的天花板)
权衡: 无偏(准) ↔ 低方差(稳) ; MSE 仲裁
直观类比
射击选手:无偏=瞄靶心(但可能手抖),低方差=弹着点集中(但可能整体偏右);MSE=弹孔到靶心的平均平方距离。冠军策略常常是"故意把枪口歪一点(引入偏差),换弹着点高度密集"——总环数反而更高。
实例或案例
- 回归系数的正则化:岭回归有偏但 MSE 常低于 OLS(kp-030 病态场景)——偏差换方差的工业级案例。
- 转化率的 Beta 平滑:k/n 有偏(向 1/2 收缩)但小样本更稳——kp-022 的先验等价物。
- 训练误差 vs 测试误差:模型复杂度↑ → 偏差↓方差↑——ML 的 U 形曲线即 MSE 分解的作画。
常见误区
- 误区一:"无偏估计必选"。MSE 视角下有偏常更优;无偏性只是对称性偏好不是金标准(James-Stein 反例)。
- 误区二:"一致估计小样本也可靠"。一致性是渐近承诺;小样本下不同一致估计的表现天差地别。
- 误区三:"MSE 恒等式需要独立性"。分解 Var+Bias² 是恒等式(无任何前提)——与 Var(X+Y) 的条件性不同(kp-007 对照)。
与其他知识点的关系
自测题
- 证明 x̄ 是 μ 的无偏估计且 Var(x̄)=σ²/n。
答:E[x̄]=μ(线性性 kp-007);Var=σ²/n(独立可加+1/n²)。
- 为什么除以 n−1 的 S² 无偏而除以 n 有偏?
答:E[Σ(Xᵢ−x̄)²]=(n−1)σ²(残差自由度 n−1,kp-017)——除 n−1 恰好还原 σ²。
- 给一个"有偏但 MSE 更优"的例子并解释。
答:正态方差估计除 n 版本(或岭回归系数)——偏差平方的增量小于方差的减量,MSE 净降。
延伸阅读
- Wasserman《All of Statistics》§9.3、§12(决策论视角)。
- Casella & Berger《Statistical Inference》第 7、10 章。
- Efron & Morris 的 James-Stein 科普文(Stein 悖论的最佳叙述)。