期望与方差:分布的中心与散布
本文基于模型知识整理(生成时未联网核对),性质与反例建议对照 Blitzstein & Hwang 第 4 章复核。
一句话定义
期望 $E[X]$ 是"概率加权的平均值"($\sum xp_p$ 或 $\int xf\,dx$)——分布的重心;方差 $\text{Var}(X)=E[(X-E[X])^2]$ 度量围绕重心的散布(平方消除正负、再开方得标准差还原量纲)——两个数字概括分布的"在哪"与"多散"。
为什么重要
期望是决策的货币(期望效用/期望损失——一切"平均而言"的判断),方差是风险的度量(投资组合、估计误差 kp-019、模型的偏差-方差分解)。两者加上线性性,让"不必知道完整分布也能推理"成为可能——这是统计与机器学习大量只用一二阶矩的深层原因。
前置知识
kp-006(PMF/PDF);级数/积分的基本收敛概念(连续版要绝对收敛,kp-030 柯西反例)。
核心概念
- 定义:离散 $E[X]=\sum_k x_kp_k$;连续 $E[X]=\int xf(x)dx$(存在性要求绝对收敛)。
- 方差的两种算式:$\text{Var}(X)=E[X^2]-(E[X])^2$(计算式)=$E[(X-\mu)^2]$(定义式);标准差 $\sigma=\sqrt{\text{Var}}$。
- 期望线性性(无独立性要求!):$E[aX+bY+c]=aE[X]+bE[Y]+c$——全概率论最实用的性质。
- 方差的性质:$\text{Var}(aX+b)=a^2\text{Var}(X)$;独立时 $\text{Var}(X+Y)=\text{Var}(X)+\text{Var}(Y)$(不独立要加 2Cov,kp-011)。
- 其他矩:k 阶原点矩 $E[X^k]$;标准化的三阶=偏度(不对称度)、四阶=峰度(尾部厚度)——高阶矩 kp-013 展开。
- 条件期望预告:$E[X|Y=y]$ 与全期望公式 $E[X]=E[E[X|Y]]$(kp-010)。
原理与机制
期望为什么是"重心":把概率质量摆在数轴上,E[X] 是让杠杆平衡的支点——两侧质量矩相消。由此"期望可以不在取值集合里"(骰子期望 3.5)与"右偏分布均值被长尾拖大"(收入分布)都一目了然。
线性性为什么不需要独立:求和的期望=期望的和,来自加法的逐项分配(Σ/∫ 的线性)——不涉及任何联合结构;这正是 kp-030 概率中"线性性免独立性、乘积要独立性"的不对称出处。方差不同:$(X+Y)^2$ 展开会多出 $2XY$ 交叉项,必须知道协方差(独立时为零)才能拆。
方差为什么用平方:直接 $E[X-\mu]$ 恒为 0(正负抵消);平方保证偏差非负且对大偏差加权(风险厌恶的数学形态)。代价是量纲平方——标准差开方还原;这也是"为什么报告里常说 ±σ 而不是 ±Var"。
公式或模型
- 期望线性:$E[\sum a_iX_i]=\sum a_iE[X_i]$
- 方差:$\text{Var}(X)=E[X^2]-\mu^2\ge0$;独立可加:$\text{Var}(\sum X_i)=\sum\text{Var}(X_i)$
- 均匀 U(a,b):$E=\frac{a+b}2$,$\text{Var}=\frac{(b-a)^2}{12}$
- 指数(率 λ):$E=\frac1\lambda$,$\text{Var}=\frac1{\lambda^2}$
直观类比
期望是"跷跷板支点":概率是各座位上的小孩体重。方差是"孩子们离支点的平均 squared 距离"——都坐在支点附近(方差小)vs 两端稀稀拉拉(方差大)。标准差把"平方距离"翻译回"米"这种能理解的单位。
实例或案例
- 彩票的负期望:奖金期望<票价——期望思维对"直觉偏乐观"的矫正器;但方差巨大解释了为何仍有人买(效用非线性,kp-033 提及)。
- 大数定律的合法性:赌场/保险公司的盈利来自正期望+大数定律(kp-014)——单次随机、长期必然。
- MLP 输出的方差距:回归模型报告预测区间需要 $\sigma$ 估计——方差的 ML 化身。
常见误区
- 误区一:"期望=最可能的值"。那是众数;期望被长尾拖拽(收入分布均值>中位数)——报告分布时先问"要重心还是要典型"。
- 误区二:"E[XY]=E[X]E[Y] 总成立"。需要独立(或不相关);线性性才无条件(不对称性 kp-030 警告)。
- 误区三:"Var(X+Y)=Var(X)+Var(Y) 随便用"。独立/不相关才行;相关时漏 2Cov 项(金融组合风险的经典坑)。
与其他知识点的关系
自测题
- X~U(0,2):求 E 与 Var。
答:E=1;Var=4/12=1/3。
- 证明 Var(aX+b)=a²Var(X)。
答:$E[(aX+b-aE[X]-b)^2]=a^2E[(X-\mu)^2]$——平移消失、缩放平方。
- X、Y 独立同分布 U(0,1),求 E[X+Y] 与 Var(X+Y)。
答:E=1;Var=1/12+1/12=1/6(独立可加)。
延伸阅读
- Blitzstein & Hwang 第 4 章(期望的对称化技巧与指示变量法)。
- Wasserman《All of Statistics》§3.4–3.6。
- 《概率论与数理统计》第 4 章(期望方差的中文标准表述)。