贝叶斯推断:参数也是随机变量

04-统计推断 前沿 约 25 分钟 #贝叶斯推断#后验#共轭先验#MAP 更新 2026-10-02
当前状态:未学
本文基于模型知识整理(生成时未联网核对),共轭族与 MCMC 预告建议对照《Bayesian Data Analysis》(Gelman 等)复核。

一句话定义

贝叶斯推断把参数 θ 视为随机变量:从先验 π(θ) 出发,用贝叶斯定理吸收数据,$π(θ|x)\propto f(x|θ)π(θ)$ 得到后验分布——推断的全部答案(点估计、区间、预测)都从后验提取:后验均值/MAP 做点估计、可信区间替代置信区间、后验预测分布做新数据预测。

为什么重要

它是与频率派(kp-018/021)并列的推断世界观:直接回答"给定数据,参数的分布是什么"(频率派被禁止的语义 kp-020),天然处理小样本与层次结构(先验=结构化先验知识),是贝叶斯深度学习、推荐系统 Beta 平滑、A/B 贝叶斯检验的底座。先验×似然=后验七个字是它的全部纲领。

前置知识

kp-004(贝叶斯定理)、kp-018(似然函数)。

核心概念

  • 流程:π(θ) 先验 → 数据 x → 似然 f(x|θ) → 后验 π(θ|x) ∝ 似然×先验(归一化常数可丢,比较/采样时)。
  • 共轭先验:先验与后验同族——Beta-Binomial(p 的先验 Beta(a,b) → 后验 Beta(a+k, b+n−k));Gamma-Poisson;Normal-Normal——共轭=更新只需更新超参数(手算可闭合、在线更新友好)。
  • Beta-Binomial 实战:转化率先验 Beta(1,1)(均匀)+ 数据(50 转化/1000 展示)→ 后验 Beta(51, 951)——后验均值 51/1002;先验就是"伪计数"(平滑 kp-029 呼应)。
  • 三种点估计:后验均值(MSE 最优 kp-019)、后验中位数(绝对误差最优)、MAP(后验众数 = 先验加权后的 MLE kp-018;λ→0 或均匀先验时退化为 MLE)。
  • 可信区间:后验分位数区间——可直接说"θ 有 95% 概率在区间内"(参数是随机变量,kp-020 的哲学对照)。
  • 后验预测分布:$p(\tilde x|x)=\int f(\tilde x|θ)π(θ|x)dθ$——对新数据的预测要平均掉参数的不确定性(不是把 θ 钉在 MAP)。
  • 计算现实:非共轭时后验无闭式 → MCMC(kp-025 马尔可夫链的采样应用 kp-027)或变分近似——现代贝叶斯的主要成本所在。

原理与机制

为什么"参数随机"解决了 kp-020 的解读难题:频率派参数固定、区间随机;贝叶斯把不确定性放进参数本身——后验分布就是"关于参数的完整知识状态",可信区间的概率语义直接自然。代价:先验的主观性/选择责任(kp-004 误区节的展开)。

共轭为什么存在且优雅:Beta 密度与二项似然在 θ 上同形(θᵃ⁻¹(1−θ)^(b−1) × θᵏ(1−θ)^(n−k) = θ^(a+k−1)(1−θ)^(b+n−k−1))——同族相乘仍是同族;超参数 a,b 的语义="先验中已经看过 a 次成功 b 次失败"——先验=记忆中的数据,这一直觉让贝叶斯平滑(kp-029 小样本推荐)失去神秘。

MAP 与 MLE 的统一:MAP = argmax [似然×先验];先验均匀 ⇒ MAP=MLE(kp-018);强先验 ⇒ 数据被拉向先验(λ 正则化=高斯先验的 MAP,kp-030 岭回归的贝叶斯解读)——两派公式层的握手处。

图示

后验 ∝ 似然 × 先验 :  π(θ|x) ∝ f(x|θ)π(θ)
共轭: Beta(a,b) 先验 + Binomial 数据 → Beta(a+k, b+n−k)
     (先验=伪计数 ; 在线更新=超参增减)
点估计: 后验均值 / 中位数 / MAP (=先验化的MLE)
可信区间: 直接"θ 有95%概率在内" (kp-020 对照)
预测: 平均掉 θ 的不确定性 (≠钉在MAP)
非共轭 → MCMC/变分 (kp-025/027 的采样舞台)

直观类比

频率派像"只信现场证据的侦探"(先验必须均匀才客观);贝叶斯派像"带着档案柜办案的老刑警"——档案(先验)+ 现场证据(似然)= 更新后的怀疑对象排序(后验)。两派看的都是证据,争论的是"档案该不该算数"(kp-033 流派)。

实例或案例

  • 小样本转化率:Beta(1,1)+3/10 → Beta(4,11),后验区间比裸频率区间稳(kp-019 偏差换方差)。
  • 多臂老虎机:各臂转化率的 Beta 后验 → Thompson 采样按后验抽样决策(kp-027 与强化学习 kp-030 姊妹)。
  • A/B 贝叶斯检验:直接算 P(p_B>p_A|数据)——决策者语言(kp-021 的对照)。

常见误区

  • 误区一:"贝叶斯不需要大样本"。先验影响随数据衰减,但小样本时结论强依赖先验——先验敏感性分析是义务。
  • 误区二:"MAP=贝叶斯答案"。MAP 只取后验一点(丢弃不确定性形状);预测/决策应基于整个后验(后验预测分布)。
  • 误区三:"共轭先验=客观"。共轭是计算便利不是真理保证;无信息先验也有隐含假设(参数化的依赖)。

与其他知识点的关系

  • kp-004:单事件版到参数分布版的升级。
  • kp-018/021:MLE 与频率检验的对照系。
  • kp-025/027:MCMC 把马尔可夫链变成推断引擎。

自测题

  1. 先验 Beta(2,2)、数据 5 成功 5 失败:后验?后验均值?

答:Beta(7,7);均值 0.5(对称先验+对称数据的优雅)。

  1. 为什么后验预测分布不直接用 MAP 参数?

答:参数不确定性被平均掉才是对未来的完整预测;钉在 MAP 会低估预测方差(过度自信)。

  1. 岭回归的贝叶斯解读?

答:高斯先验 N(0,τ²) 下系数的 MAP——λ=σ²/τ²(kp-030 岭回归=先验惩罚的频率译名)。

延伸阅读

  • Gelman 等《Bayesian Data Analysis》第 1–3 章(权威教材)。
  • Davidson-Pilon《Bayesian Methods for Hackers》(PyMC 实战免费书)。
  • Efron & Hastie《Computer Age Statistical Inference》(两派对比的当代综述)。