最大似然估计:让数据最有面子的参数

04-统计推断 核心 约 25 分钟 #最大似然#MLE#似然函数#对数似然 更新 2026-10-02
当前状态:未学
本文基于模型知识整理(生成时未联网核对),MLE 性质建议对照 Wasserman §9 或 Casella & Berger 第 7 章复核。

一句话定义

最大似然估计(MLE)为参数 θ 挑选"使已观测数据出现概率最大"的值:似然函数 $L(\theta)=\prod_i f(x_i;\theta)$(视为 θ 的函数),取 $\hat\theta=\arg\max L$——通常对数化(log-likelihood 求和)后求驻点(微积分 kp-022 梯度置零)。

为什么重要

MLE 是频率派推断的通用引擎:二项的 p̂=k/n、正态的 μ̂=x̄、逻辑回归/深度网络的训练目标(交叉熵=负对数似然)全是 MLE 的化身。它还自带渐近理论(一致性/渐近正态/渐近有效,kp-019)——"写似然、求梯度、上优化器"是现代统计与 ML 的统一工作流(kp-028 的损失=负对数似然)。

前置知识

kp-007/008/009(分布族)、kp-022 矩阵微积分(连续参数)。

核心概念

  • 似然 vs 概率:同一公式 $P(\text{数据}|\theta)$,自变量视角不同——固定 θ 看数据是概率,固定数据看 θ 是似然。似然不需要归一化(比较 θ 时的常数可丢)。
  • 对数似然:$\ell(\theta)=\sum_i\log f(x_i;\theta)$——连乘变连加(数值稳定)、指数族化线性;最大化 $\ell$ 与 $L$ 等价(log 单调)。
  • 求法:$\ell'(\theta)=0$ 求驻点(+二阶确认最大);无解析解时数值优化(kp-028 的梯度法家族)。
  • 经典解析解:正态 μ̂=x̄、σ̂²=均方差(除 n 版本,有偏 kp-019);二项 p̂=k/n;泊松 λ̂=样本均值;均匀 U(0,θ) 的 θ̂=max(xᵢ)(边界解——导数法失效的警示案例)。
  • 不变性:$g(\theta)$ 的 MLE = $g(\hat\theta)$——变换后的参数不用重新优化。
  • 渐近三性质(大样本):一致性(→真值)、渐近正态($\hat\theta\approx N(\theta, I^{-1}(\theta)/n)$,I 为 Fisher 信息)、渐近有效(方差达到 Cramér-Rao 下界)——MLE 的"渐近冠军"身份。

原理与机制

为什么"似然最大"是合理的准则:它是"发生的事就是容易发生的"原则的形式化——在所有候选 θ 中,选择让现实"最不惊讶"的那个;贝叶斯视角(kp-022)下 MLE = 先验均匀时的后验众数——两种流派在此握手。

为什么对数化:① 独立样本的联合似然是连乘,log 变连加(kp-007 期望的线性性可作用);② 下溢防护(几十个 <1 的数连乘下溢);③ 指数族的 log-likelihood 是 θ 的凹函数(唯一最优,kp-027 凸性福利)。

MLE 的代价与陷阱:小样本可能偏差明显(正态 σ̂² 除 n 版本);重尾/混合下多峰似然需要数值功夫;均匀边界案例提醒"导数法不是万能模板"——似然的支撑集依赖 θ 时驻点法失效,要看边界。

图示

L(θ) = Π f(xᵢ;θ)   ;  ℓ(θ) = Σ log f(xᵢ;θ)
MLE: θ̂ = argmax ℓ(θ)  → ℓ′(θ̂)=0 (+凹性/二阶确认)
正态: μ̂=x̄ ; σ̂²=(1/n)Σ(xᵢ−x̄)²
二项: p̂=k/n ;  泊松: λ̂=x̄
渐近: θ̂ ≈ N(θ, 1/(n·I(θ)))   (一致+渐近有效)
交叉熵 = −log似然 → 深度学习训练目标 (kp-031)

直观类比

MLE 像"根据脚印猜体型":同一串脚印(数据),不同体型的动物都会留下脚印(似然),挑"最可能踩出这串脚印"的那只。对数化像"把连续拍照改成逐张翻阅"——同一结论,翻阅(求和)比对着整卷胶片(连乘)容易。

实例或案例

  • 点击率估计:n 次展示 k 次点击 → p̂=k/n(二项 MLE);加先验后变 Beta 后验(kp-022 的平滑版)。
  • 指数寿命数据:λ̂=1/x̄——设备寿命/客服时长的默认估计。
  • 逻辑回归:logistic 模型的交叉熵损失=负对数似然——"训练=MLE"的深度学习桥(kp-031)。

常见误区

  • 误区一:"MLE 总是无偏"。正态 σ̂²(除 n)有偏(kp-019 修正);小样本偏差是常态,MLE 的美德在渐近。
  • 误区二:"似然=概率,可以积分成 1"。似然不归一(θ 积分无意义除非贝叶斯配先验 kp-022)——概念纪律。
  • 误区三:"对一切模型都求导"。支撑依赖 θ(均匀)或离散支撑时导数法失效——先看参数"住在哪里"。

与其他知识点的关系

  • kp-007/008/009:分布族的似然工厂。
  • kp-019:MLE 的成绩单(三渐近性质)。
  • kp-022:贝叶斯版=似然×先验(后验众数=MAP)。
  • kp-028:负对数似然作为损失函数的优化。

自测题

  1. 推导泊松分布 λ 的 MLE。

答:$\ell=\sum(x_i\log\lambda-\lambda-\log x_i!)$,$\ell'=\frac{\sum x_i}{\lambda}-1=0$ → λ̂=x̄。

  1. 为什么均匀 U(0,θ) 的 MLE 是 max(xᵢ)?

答:θ<max(xᵢ) 时似然=0;θ=max 时似然最大(1/θⁿ 递减)——边界解,导数法失效。

  1. MLE 的三条渐近性质是什么?对实践的意义?

答:一致、渐近正态(方差=1/(nI))、渐近有效——大样本下 MLE 既准又能构造置信区间(kp-020)。

延伸阅读

  • Wasserman《All of Statistics》第 9 章。
  • Casella & Berger《Statistical Inference》第 7 章。
  • 《统计学习方法》(李航)第 1、6 章(MLE 与逻辑回归的对接)。