多元正态分布:高斯的世界

05-进阶主题 进阶 约 25 分钟 #多元正态#协方差矩阵#条件正态#马氏距离 更新 2026-10-02
当前状态:未学
本文基于模型知识整理(生成时未联网核对),条件分布公式建议对照 Wasserman §7 或 Bishop §2.3 复核。

一句话定义

多元正态 $X\sim N(\mu,\Sigma)$ 的密度由均值向量 μ 与协方差矩阵 Σ 完全决定:$f(x)=(2\pi)^{-k/2}|\Sigma|^{-1/2}e^{-\frac12(x-\mu)^\top\Sigma^{-1}(x-\mu)}$——等密度面是椭球(kp-030 线性代数姊妹篇),其轴向/扁度由 Σ 的特征系统决定;它对线性变换封闭、条件分布仍是正态——"高斯的世界里一切都是高斯"。

为什么重要

它是多元统计的默认舞台:PCA(协方差特征分解,kp-030 姊妹篇)、线性回归的误差假设、贝叶斯线性回归、高斯过程、卡尔曼滤波、VAE 的隐变量——几乎所有连续模型都以多元正态为起点或终点。"均值+协方差就够"的可计算性是其他分布无法匹敌的工程红利。

前置知识

kp-009(一元正态)、kp-011(协方差矩阵)、线性代数基础(矩阵、特征值——自含最小需求)。

核心概念

  • 密度与几何:$\Sigma$ 对称半正定;等密度面 $\{(x-\mu)^\top\Sigma^{-1}(x-\mu)=c\}$ 是椭球——主轴方向=Σ 的特征向量、半轴长 ∝√特征值(椭圆怎么躺由数据相关性决定)。
  • 马氏距离:$d_M(x)=(x-\mu)^\top\Sigma^{-1}(x-\mu)$ 的平方根——"计入相关性的欧氏距离"(各向异性量尺);离群检测用它而非欧氏距离。
  • 边缘分布:多元正态的任意子集分量仍正态 $X_A\sim N(\mu_A,\Sigma_{AA})$——"高斯世界的边缘掉不坏"。
  • 条件分布(最重要的公式):分块

$$\mu_{1|2}=\mu_1+\Sigma_{12}\Sigma_{22}^{-1}(x_2-\mu_2),\quad \Sigma_{1|2}=\Sigma_{11}-\Sigma_{12}\Sigma_{22}^{-1}\Sigma_{21}$$ ——条件均值=边缘均值+线性修正;条件协方差=边缘协方差−"被解释掉的部分"。看见 x₂ 后关于 x₁ 的不确定性减小(信息=降方差)。

  • 不相关⇔独立(高斯特权):对多元正态,零协方差严格等价于独立——kp-011 的一般反例在高斯世界失效。
  • 线性变换封闭:$AX+b\sim N(A\mu+b, A\Sigma A^\top)$——线性层的输入输出高斯性传递(kp-031 的深度学习注脚:只有非线性才能离开高斯世界)。

原理与机制

为什么条件均值的公式如此结构化:$\Sigma_{12}\Sigma_{22}^{-1}$ 是"最优线性预测系数"(回归系数!)——用 x₂ 的偏差线性解释 x₁ 的偏差;残差协方差 $\Sigma_{1|2}$ 是"解释不掉的剩余"。条件正态公式=线性回归+剩余方差的合一——回归与条件分布在此同一(回归的贝叶斯视角 kp-022)。

为什么高斯对线性封闭:MGF/特征函数视角(kp-013)——多元正态的 CF 是 $\mu^\top t+\frac12t^\top\Sigma t$ 的指数;线性变换只改 μ 与 Σ,形式不变。封闭性=计算红利:滤波、回归、EM 中"高斯进高斯出"的推导全程可闭式。

Σ 的病态警示:$\Sigma$ 接近奇异(强相关变量)⇒ 逆不存在/条件数爆炸(微积分 kp-030 的线性代数姊妹)——病态高斯的条件分布数值不稳,需要正则化。

图示

N(μ,Σ): f ∝ exp(−½(x−μ)ᵀΣ⁻¹(x−μ))
几何: 等密度椭球 = Σ 的特征向量(轴) + √λ(半轴)
马氏距离: 计入相关的离群度量
边缘: 任意子集仍正态
条件: μ₁₊₂ = μ₁+Σ₁₂Σ₂₂⁻¹(x₂−μ₂)  (线性修正=回归)
     Σ₁₊₂ = Σ₁₁−Σ₁₂Σ₂₂⁻¹Σ₂₁  (解释掉的不确定性)
特权: 不相关 ⇔ 独立 ; AX+b 仍正态

直观类比

一元正态是"一条钟形曲线";多元正态是"山丘等高线图"——相关正=斜长的椭圆、相关零=正圆、病态=针状椭圆(两个变量几乎是同一个变量)。条件分布像"站在山腰某条线上(固定 x₂)看山的高矮分布"——信息让山丘收窄成更确定的小山。

实例或案例

  • 相关数据生成:Σ 打造成想要的正/负相关椭圆——np.random.multivariate_normal(kp-032)。
  • 卡尔曼滤波:预测=高斯、观测=高斯、更新=条件分布公式——机器人定位/导航的每一步都是 kp-023 公式的运行。
  • GPA 与成绩的选型偏差:椭圆内采样+按截断分析=选择偏差的模拟器(kp-028 的实验场)。

常见误区

  • 误区一:"边缘正态+任意相关=联合正态"。联合正态才能保证;构造"边缘正态、联合非正态"的反例很容易(Copula 的领地)——"两个正态拼起来"不是多元正态。
  • 误区二:"Σ 可任意取"。必须对称半正定;非法 Σ(负方差方向)会让密度指数爆炸。
  • 误区三:"条件协方差减小的方向想反"。$\Sigma_{1|2}=\Sigma_{11}-\Sigma_{12}\Sigma_{22}^{-1}\Sigma_{21}$ 是减法——观测永远不增加不确定性(半正定差)。

与其他知识点的关系

  • kp-009/011:一元正态与协方差的升维。
  • kp-024:KL 散度的高斯闭式(变分推断 kp-027 的损失函数)。
  • kp-030/031:PCA/卡尔曼/高斯过程的家族回响。

自测题

  1. 二元标准正态相关 ρ:条件分布 X₁|X₂=x₂?

答:$N(\rho x_2,\ 1-\rho^2)$——线性修正 ρx₂、剩余方差 1−ρ²(回归斜率=相关系数,标准化下)。

  1. 为什么马氏距离比欧氏距离适合相关数据?

答:Σ⁻¹ 按各方向方差重新量尺、按相关性解耦——椭圆坐标下的真"直线距离"。

  1. 独立多元正态的和仍是多元正态吗?给出理由。

答:是——线性变换封闭性(拼接+求和=线性映射 AX+b)。

延伸阅读

  • Wasserman《All of Statistics》第 7 章。
  • Bishop《Pattern Recognition and Machine Learning》§2.3(条件/边缘推导最细)。
  • 《Probability and Statistics》DeGroot 第 5 章。