最大似然估计:让数据最有面子的参数
本文基于模型知识整理(生成时未联网核对),MLE 性质建议对照 Wasserman §9 或 Casella & Berger 第 7 章复核。
一句话定义
最大似然估计(MLE)为参数 θ 挑选"使已观测数据出现概率最大"的值:似然函数 $L(\theta)=\prod_i f(x_i;\theta)$(视为 θ 的函数),取 $\hat\theta=\arg\max L$——通常对数化(log-likelihood 求和)后求驻点(微积分 kp-022 梯度置零)。
为什么重要
MLE 是频率派推断的通用引擎:二项的 p̂=k/n、正态的 μ̂=x̄、逻辑回归/深度网络的训练目标(交叉熵=负对数似然)全是 MLE 的化身。它还自带渐近理论(一致性/渐近正态/渐近有效,kp-019)——"写似然、求梯度、上优化器"是现代统计与 ML 的统一工作流(kp-028 的损失=负对数似然)。
前置知识
kp-007/008/009(分布族)、kp-022 矩阵微积分(连续参数)。
核心概念
- 似然 vs 概率:同一公式 $P(\text{数据}|\theta)$,自变量视角不同——固定 θ 看数据是概率,固定数据看 θ 是似然。似然不需要归一化(比较 θ 时的常数可丢)。
- 对数似然:$\ell(\theta)=\sum_i\log f(x_i;\theta)$——连乘变连加(数值稳定)、指数族化线性;最大化 $\ell$ 与 $L$ 等价(log 单调)。
- 求法:$\ell'(\theta)=0$ 求驻点(+二阶确认最大);无解析解时数值优化(kp-028 的梯度法家族)。
- 经典解析解:正态 μ̂=x̄、σ̂²=均方差(除 n 版本,有偏 kp-019);二项 p̂=k/n;泊松 λ̂=样本均值;均匀 U(0,θ) 的 θ̂=max(xᵢ)(边界解——导数法失效的警示案例)。
- 不变性:$g(\theta)$ 的 MLE = $g(\hat\theta)$——变换后的参数不用重新优化。
- 渐近三性质(大样本):一致性(→真值)、渐近正态($\hat\theta\approx N(\theta, I^{-1}(\theta)/n)$,I 为 Fisher 信息)、渐近有效(方差达到 Cramér-Rao 下界)——MLE 的"渐近冠军"身份。
原理与机制
为什么"似然最大"是合理的准则:它是"发生的事就是容易发生的"原则的形式化——在所有候选 θ 中,选择让现实"最不惊讶"的那个;贝叶斯视角(kp-022)下 MLE = 先验均匀时的后验众数——两种流派在此握手。
为什么对数化:① 独立样本的联合似然是连乘,log 变连加(kp-007 期望的线性性可作用);② 下溢防护(几十个 <1 的数连乘下溢);③ 指数族的 log-likelihood 是 θ 的凹函数(唯一最优,kp-027 凸性福利)。
MLE 的代价与陷阱:小样本可能偏差明显(正态 σ̂² 除 n 版本);重尾/混合下多峰似然需要数值功夫;均匀边界案例提醒"导数法不是万能模板"——似然的支撑集依赖 θ 时驻点法失效,要看边界。
图示
L(θ) = Π f(xᵢ;θ) ; ℓ(θ) = Σ log f(xᵢ;θ)
MLE: θ̂ = argmax ℓ(θ) → ℓ′(θ̂)=0 (+凹性/二阶确认)
正态: μ̂=x̄ ; σ̂²=(1/n)Σ(xᵢ−x̄)²
二项: p̂=k/n ; 泊松: λ̂=x̄
渐近: θ̂ ≈ N(θ, 1/(n·I(θ))) (一致+渐近有效)
交叉熵 = −log似然 → 深度学习训练目标 (kp-031)
直观类比
MLE 像"根据脚印猜体型":同一串脚印(数据),不同体型的动物都会留下脚印(似然),挑"最可能踩出这串脚印"的那只。对数化像"把连续拍照改成逐张翻阅"——同一结论,翻阅(求和)比对着整卷胶片(连乘)容易。
实例或案例
- 点击率估计:n 次展示 k 次点击 → p̂=k/n(二项 MLE);加先验后变 Beta 后验(kp-022 的平滑版)。
- 指数寿命数据:λ̂=1/x̄——设备寿命/客服时长的默认估计。
- 逻辑回归:logistic 模型的交叉熵损失=负对数似然——"训练=MLE"的深度学习桥(kp-031)。
常见误区
- 误区一:"MLE 总是无偏"。正态 σ̂²(除 n)有偏(kp-019 修正);小样本偏差是常态,MLE 的美德在渐近。
- 误区二:"似然=概率,可以积分成 1"。似然不归一(θ 积分无意义除非贝叶斯配先验 kp-022)——概念纪律。
- 误区三:"对一切模型都求导"。支撑依赖 θ(均匀)或离散支撑时导数法失效——先看参数"住在哪里"。
与其他知识点的关系
自测题
- 推导泊松分布 λ 的 MLE。
答:$\ell=\sum(x_i\log\lambda-\lambda-\log x_i!)$,$\ell'=\frac{\sum x_i}{\lambda}-1=0$ → λ̂=x̄。
- 为什么均匀 U(0,θ) 的 MLE 是 max(xᵢ)?
答:θ<max(xᵢ) 时似然=0;θ=max 时似然最大(1/θⁿ 递减)——边界解,导数法失效。
- MLE 的三条渐近性质是什么?对实践的意义?
答:一致、渐近正态(方差=1/(nI))、渐近有效——大样本下 MLE 既准又能构造置信区间(kp-020)。
延伸阅读
- Wasserman《All of Statistics》第 9 章。
- Casella & Berger《Statistical Inference》第 7 章。
- 《统计学习方法》(李航)第 1、6 章(MLE 与逻辑回归的对接)。