- 概率论
- 为随机现象建立可计算数学模型的学科(Kolmogorov 公理化体系)。
- 样本空间 Ω
- 随机实验全部可能结果的集合。
- 事件
- 样本空间的子集;事件的运算=集合运算。
- 概率公理(Kolmogorov)
- 非负、P(Ω)=1、互不相容可列可加。
- 加法公式
- P(A∪B)=P(A)+P(B)−P(A∩B)(容斥)。
- De Morgan 律
- (A∪B)ᶜ=Aᶜ∩Bᶜ——"至少一个"与"全不"互译。
- 互不相容
- P(A∩B)=0(不能同时发生);与独立几乎相反。
- 条件概率
- P(A|B)=P(A∩B)/P(B)——B 发生后 A 的更新概率。
- 全概率公式
- P(A)=ΣP(A|Bᵢ)P(Bᵢ)——按划分加权。
- 贝叶斯定理
- P(H|D)=P(D|H)P(H)/P(D)——先验×似然=后验(归一化前∝)。
- 先验/后验/似然
- 证据前的信念 / 证据后的信念 / 假设下数据的概率。
- 独立性
- P(A∩B)=P(A)P(B);一方不改变另一方的概率。
- 条件独立
- 给定 C 后 P(A∩B|C)=P(A|C)P(B|C)(朴素贝叶斯假设)。
- 乘法原理/排列/组合
- 计数三件套——Πmᵢ、n!/(n−k)!、n!/(k!(n−k)!)。
- 随机变量
- 样本空间到实数的函数——随机结果的数字编码。
- PMF(概率质量函数)
- 离散分布 pₖ=P(X=k),Σ=1。
- PDF(概率密度函数)
- 连续分布 f,∫f=1;密度值不是概率(可>1)。
- CDF(累积分布函数)
- F(x)=P(X≤x);单调不减、右连续、通吃离散/连续/混合。
- 期望 E[X]
- 概率加权的平均值——分布的重心。
- 方差/标准差
- Var=E[(X−μ)²];σ=√Var——散布度量。
- 期望线性性
- E[ΣaᵢXᵢ]=ΣaᵢE[Xᵢ]——无条件成立(最实用性质)。
- 伯努利/二项分布
- 单次成败 / n 次独立成败的成功数 Bin(n,p)。
- 几何分布
- 首次成功前的等待次数;无记忆性。
- 泊松分布
- 单位时间稀有事件计数 Pois(λ);二项的 n 大 p 小极限;E=Var=λ。
- 均匀分布
- 区间内处处等可能;随机数生成器的默认语义。
- 指数分布
- 等待时间的连续模型 Exp(λ);无记忆性;泊松计数的孪生。
- 正态分布
- 钟形 N(μ,σ²);CLT 的极限形态;标准化 Z=(X−μ)/σ。
- 68-95-99.7 法则
- 正态 ±1σ/±2σ/±3σ 的概率锚点。
- 联合/边缘/条件分布
- 组合账 / 单方账(求和积分)/ 给定一方后的账。
- 全期望公式
- E[Y]=E[E[Y|X]]——分层计算均值。
- 方差分解
- Var(Y)=E[Var(Y|X)]+Var(E[Y|X])(恒等式)。
- 协方差/相关系数
- 线性联动度量 Cov=E[XY]−E[X]E[Y];ρ∈[−1,1]。
- 不相关⇏独立
- ρ=0 只排除线性关系(Y=X² 反例)。
- 矩
- E[Xᵏ](k 阶原点矩);均值/方差/偏度/峰度是低阶矩的名字。
- 矩母函数(MGF)
- M(t)=E[e^{tX}];求导出矩、唯一决定分布、独立和=乘积。
- 大数定律(LLN)
- 样本均值收敛到期望——长期频率的稳定性。
- 中心极限定理(CLT)
- 标准化样本均值依分布收敛到 N(0,1)。
- 标准误(SE)
- σ/√n——样本均值的标准差;精度∝√n。
- 马尔可夫不等式
- P(X≥a)≤E[X]/a(X≥0)——期望兜住右尾。
- 切比雪夫不等式
- P(|X−μ|≥a)≤σ²/a²——方差收紧双侧尾。
- 统计量
- 样本的不含未知参数的函数(x̄、S²)。
- 抽样分布
- 统计量在重复抽样下的分布(推断的通货)。
- 自由度
- 独立信息量;S² 除以 n−1 的来源。
- t/χ²/F 分布
- 正态家族三大抽样分布(厚尾/平方和/方差比)。
- 似然函数
- L(θ)=Πf(xᵢ;θ)——固定数据看参数的函数(不归一)。
- 最大似然估计(MLE)
- argmax L(θ);一致+渐近正态+渐近有效。
- 无偏/一致性
- E[θ̂]=θ / θ̂ₙ→P θ——估计量的准与稳。
- MSE
- Var+Bias²——估计总误差的恒等式分解。
- 置信区间
- 方法长期覆盖 95% 的随机区间(频率派语义)。
- 假设检验
- H₀ 下数据极端程度的反证法(只能拒绝不能证明)。
- p 值
- P(数据如此极端|H₀真)——数据的属性,不是假设的概率。
- 第一类/第二类错误
- 假阳性 α / 假阴性 β;功效=1−β。
- 多重比较
- 1−(1−α)^m 膨胀 → Bonferroni/FDR 校正。
- 贝叶斯推断
- π(θ|x)∝f(x|θ)π(θ)——参数的后验分布是全部答案。
- 共轭先验
- 先验与后验同族(Beta-Binomial 等);先验=伪计数。
- MAP
- 后验众数——先验化的 MLE;均匀先验时两者重合。
- 多元正态
- N(μ,Σ);等密度椭球;条件分布仍正态(线性修正公式)。
- 马氏距离
- 计入协方差的离群度量 (x−μ)ᵀΣ⁻¹(x−μ)。
- 熵
- H=−Σp log p——不确定性的比特刻度;均匀最大、确定最小。
- KL 散度
- D(P‖Q)=Σp log(p/q)≥0;非对称非距离。
- 交叉熵
- H(P,Q)=H(P)+D(P‖Q);分类损失=负对数似然。
- 互信息
- I(X;Y)=D(P(X,Y)‖P_X P_Y)——知道 Y 消除的 X 不确定性。
- 马尔可夫链
- 下一步只依赖当前状态的随机过程(转移矩阵 P)。
- 平稳分布
- πP=π;遍历链从任何初值收敛到它。
- 细致平衡
- πᵢp_{ij}=πⱼp_{ji}——MCMC 的构造原理。
- 蒙特卡洛方法
- 随机采样均值逼近期望/积分;误差∝1/√n(与维度无关)。
- 方差缩减
- 对偶变量/控制变量/重要性采样——降估计量方差。
- 逆变换采样
- X=F⁻¹(U)——单调 CDF 的精确采样法。
- 拒绝采样
- 包络 Mq 下接受-拒绝;效率=1/M。
- 重要性采样
- 从 q 采样按 p/q 加权估计期望;q 必须覆盖 p 尾部。
- MCMC
- 以目标为平稳分布的马尔可夫链采样(MH/Gibbs)。
- 辛普森悖论
- 分层与聚合结论相反——混杂变量的权重翻转。
- 赌徒谬误
- 独立事件"该反转了"的错觉(LLN 靠稀释不靠补偿)。
- 基率忽视
- 忽略人群基数只看检测准确率(贝叶斯定理的解药)。
- 合取谬误
- P(A∩B)>P(A) 的直觉违规(细节越多概率越低)。
- 生日悖论
- 23 人 50% 撞生日;哈希碰撞约 2^{b/2} 次。
- 幸存者偏差
- 样本被"是否出现"筛选后的系统性误导。
- p-hacking
- 多次尝试/选择性报告直到显著——复现危机的核心机制。
- ASA 六原则
- 美国统计学会关于 p 值正确使用与限制的声明(2016)。