贝叶斯定理:信念更新的公式
本文基于模型知识整理(生成时未联网核对),应用案例建议对照 Blitzstein & Hwang 第 2 章与《Bayesian Methods for Hackers》复核。
一句话定义
贝叶斯定理把条件概率"反过来算": $$P(H|D)=\frac{P(D|H)\,P(H)}{P(D)}$$ ——先验 P(H)(证据前的信念)×似然 P(D|H)(假设对数据的解释力)÷证据 P(D),得到后验 P(H|D)(证据后的信念);它是"新证据下理性更新"的唯一公式。
为什么重要
它是现代人工智能的认知引擎:垃圾邮件过滤、医疗诊断、A/B 检验的贝叶斯版、贝叶斯深度学习、大模型的 RLHF 哲学——凡"从数据反推原因"的场景都是它的领地。更普遍地,它给出理性更新的完整语法:后验 ∝ 似然 × 先验——数据不会直接告诉你真相,它只按各假设的解释力重新分配你的信念。
前置知识
kp-003(条件概率与全概率公式)。
核心概念
- 定理:$P(H|D)=\dfrac{P(D|H)P(H)}{P(D)}$,其中 $P(D)=P(D|H)P(H)+P(D|\bar H)P(\bar H)$(全概率,kp-003)。
- 四个角色:
- 先验 P(H):看到数据前的信念(人群患病率 1%); - 似然 P(D|H):假设为真时看到数据的概率(灵敏度 99%); - 后验 P(H|D):看到数据后的信念(检测阳性时患病概率); - 证据 P(D):数据的无条件概率(归一化常数,保证后验和为 1)。
- 比例形式:$P(H|D)\propto P(D|H)P(H)$——分母在比较多个假设时可以省略,"后验 ∝ 似然×先验"是最常用形态。
- 诊断经典数值(本库反复使用):患病率 1%、灵敏度 99%(真阳)、假阳率 5% ⇒
$$P(\text{病}|\text{阳})=\frac{0.99×0.01}{0.99×0.01+0.05×0.99}≈16.7\%$$ ——阳性结果下大概率仍没病,因为健康基数巨大(基率忽视的直接解药,kp-029)。
- 连续版预告:先验/后验变成分布,$π(θ|D)∝f(D|θ)π(θ)$——贝叶斯推断(kp-022)与共轭先验的舞台。
原理与机制
为什么直觉会算错:人们把 P(D|H)(检测准确率,抢眼的 99%)错当 P(H|D);两个条件概率方向相反(kp-003 的误区),而真正决定后验的是先验与假阳率的对比。贝叶斯定理的价值=强制你在正确的分母上做除法。
为什么"基率"如此决定性:后验分子是 0.99×0.01=0.0099,分母还要加上健康人假阳 0.05×0.99=0.0495——假阳项比真阳项大 5 倍,只因健康人是病人的 99 倍。罕见事件+不完美检测 = 大概率虚警,这是安检、筛查、风控的通用教训。
更新链:今天的后验是明天的先验——多次检测/多轮证据迭代更新(两次独立阳性后概率升到 ~81%);这一"信念的动力学"在 kp-022 中被正式化为贝叶斯推断的完整流程。
似然与后验的方向纪律:似然永远写 P(数据|假设)——建模者能控制的是"假设下数据的分布";贝叶斯公式负责倒转方向。MLE(kp-018)只用似然(挑解释力最强的假设),贝叶斯多乘一个先验(保留不确定性)——两派的分水岭(kp-033 流派)。
图示
P(D|H)·P(H)
P(H|D)=────────────── ; P(D)=P(D|H)P(H)+P(D|H̄)P(H̄)
P(D)
诊断: 先验1% | 灵敏度99% | 假阳5%
→ P(病|阳)=0.0099/0.0594 ≈ 16.7%
更新链: 后验ₜ₊₁ = 先验ₜ₊₁ ; 比例形式: 后验 ∝ 似然×先验
方向纪律: 似然 = P(数据|假设), 永远不写反
直观类比
贝叶斯定理像"法庭审理":先验=被告此前的社会背景嫌疑度;似然=控方证据在"有罪假设"下的出现概率;后验=听完证据后的合理怀疑。辩方永远会喊"这个证据在无辜者身上也会出现"(分母的另一项)——法官的职责就是别让控方的 99% 灵敏度冒充 99% 的定罪率。
实例或案例
- 垃圾邮件过滤:词"免费"在垃圾邮件出现率高(似然),但正常邮件也偶发——后验按先验(邮件总量比例)加权。
- 恐怖安检:"警报响时真是恐怖分子的概率"极低——同样因基率极低+假阳不可忽略;理解这点避免"宁可错杀"的政策误推(kp-031 伦理)。
- A/B 检验的贝叶斯版:转化率先验 + 实验数据 → 后验分布直接回答"P(B 比 A 好"(kp-022 与 kp-021 频率派的对照)。
常见误区
- 误区一:"P(H|D) 与 P(D|H) 混写"。全库最高频错误(kp-003/031 重复警告);写公式前先问"谁是数据谁是假设"。
- 误区二:"忽略先验只看似然"。罕见事件筛查中先验主导后验;"99% 准确"的广告在 1% 基率下几乎无用。
- 误区三:"先验随意设所以贝叶斯不客观"。先验影响随数据量衰减;且先验本身可被数据检验与更新(层级贝叶斯)——先验自由≠任意(kp-022/031)。
与其他知识点的关系
自测题
- 患病率 2%、灵敏度 95%、假阳 4%:阳性时患病概率?
答:$\frac{0.95×0.02}{0.95×0.02+0.04×0.98}=\frac{0.019}{0.0582}≈32.6\%$。
- 两次独立检测(同灵敏度/假阳)都阳性,重算上题。
答:似然连乘 (0.95)²×0.02 vs (0.04)²×0.98 → 后验≈$\frac{0.01805}{0.01805+0.001568}≈92\%$——更新链威力。
- 为什么"先验+似然"而非"似然单独"构成贝叶斯推断?
答:似然只排序解释力;先验携带基率与既有知识,二者相乘才把"解释力"换算成"信念份额"——无先验的推断在罕见事件上系统性失真。
延伸阅读
- Blitzstein & Hwang 第 2 章(贝叶斯猫头鹰与实例)。
- Davidson-Pilon《Bayesian Methods for Hackers》(免费在线,Python 实战)。
- 《概率论与数理统计》贝叶斯公式节。