术语表 (79 条)

概率论
为随机现象建立可计算数学模型的学科(Kolmogorov 公理化体系)。
样本空间 Ω
随机实验全部可能结果的集合。
事件
样本空间的子集;事件的运算=集合运算。
概率公理(Kolmogorov)
非负、P(Ω)=1、互不相容可列可加。
加法公式
P(A∪B)=P(A)+P(B)−P(A∩B)(容斥)。
De Morgan 律
(A∪B)ᶜ=Aᶜ∩Bᶜ——"至少一个"与"全不"互译。
互不相容
P(A∩B)=0(不能同时发生);与独立几乎相反。
条件概率
P(A|B)=P(A∩B)/P(B)——B 发生后 A 的更新概率。
全概率公式
P(A)=ΣP(A|Bᵢ)P(Bᵢ)——按划分加权。
贝叶斯定理
P(H|D)=P(D|H)P(H)/P(D)——先验×似然=后验(归一化前∝)。
先验/后验/似然
证据前的信念 / 证据后的信念 / 假设下数据的概率。
独立性
P(A∩B)=P(A)P(B);一方不改变另一方的概率。
条件独立
给定 C 后 P(A∩B|C)=P(A|C)P(B|C)(朴素贝叶斯假设)。
乘法原理/排列/组合
计数三件套——Πmᵢ、n!/(n−k)!、n!/(k!(n−k)!)。
随机变量
样本空间到实数的函数——随机结果的数字编码。
PMF(概率质量函数)
离散分布 pₖ=P(X=k),Σ=1。
PDF(概率密度函数)
连续分布 f,∫f=1;密度值不是概率(可>1)。
CDF(累积分布函数)
F(x)=P(X≤x);单调不减、右连续、通吃离散/连续/混合。
期望 E[X]
概率加权的平均值——分布的重心。
方差/标准差
Var=E[(X−μ)²];σ=√Var——散布度量。
期望线性性
E[ΣaᵢXᵢ]=ΣaᵢE[Xᵢ]——无条件成立(最实用性质)。
伯努利/二项分布
单次成败 / n 次独立成败的成功数 Bin(n,p)。
几何分布
首次成功前的等待次数;无记忆性。
泊松分布
单位时间稀有事件计数 Pois(λ);二项的 n 大 p 小极限;E=Var=λ。
均匀分布
区间内处处等可能;随机数生成器的默认语义。
指数分布
等待时间的连续模型 Exp(λ);无记忆性;泊松计数的孪生。
正态分布
钟形 N(μ,σ²);CLT 的极限形态;标准化 Z=(X−μ)/σ。
68-95-99.7 法则
正态 ±1σ/±2σ/±3σ 的概率锚点。
联合/边缘/条件分布
组合账 / 单方账(求和积分)/ 给定一方后的账。
全期望公式
E[Y]=E[E[Y|X]]——分层计算均值。
方差分解
Var(Y)=E[Var(Y|X)]+Var(E[Y|X])(恒等式)。
协方差/相关系数
线性联动度量 Cov=E[XY]−E[X]E[Y];ρ∈[−1,1]。
不相关⇏独立
ρ=0 只排除线性关系(Y=X² 反例)。
矩
E[Xᵏ](k 阶原点矩);均值/方差/偏度/峰度是低阶矩的名字。
矩母函数(MGF)
M(t)=E[e^{tX}];求导出矩、唯一决定分布、独立和=乘积。
大数定律(LLN)
样本均值收敛到期望——长期频率的稳定性。
中心极限定理(CLT)
标准化样本均值依分布收敛到 N(0,1)。
标准误(SE)
σ/√n——样本均值的标准差;精度∝√n。
马尔可夫不等式
P(X≥a)≤E[X]/a(X≥0)——期望兜住右尾。
切比雪夫不等式
P(|X−μ|≥a)≤σ²/a²——方差收紧双侧尾。
统计量
样本的不含未知参数的函数(x̄、S²)。
抽样分布
统计量在重复抽样下的分布(推断的通货)。
自由度
独立信息量;S² 除以 n−1 的来源。
t/χ²/F 分布
正态家族三大抽样分布(厚尾/平方和/方差比)。
似然函数
L(θ)=Πf(xᵢ;θ)——固定数据看参数的函数(不归一)。
最大似然估计(MLE)
argmax L(θ);一致+渐近正态+渐近有效。
无偏/一致性
E[θ̂]=θ / θ̂ₙ→P θ——估计量的准与稳。
MSE
Var+Bias²——估计总误差的恒等式分解。
置信区间
方法长期覆盖 95% 的随机区间(频率派语义)。
假设检验
H₀ 下数据极端程度的反证法(只能拒绝不能证明)。
p 值
P(数据如此极端|H₀真)——数据的属性,不是假设的概率。
第一类/第二类错误
假阳性 α / 假阴性 β;功效=1−β。
多重比较
1−(1−α)^m 膨胀 → Bonferroni/FDR 校正。
贝叶斯推断
π(θ|x)∝f(x|θ)π(θ)——参数的后验分布是全部答案。
共轭先验
先验与后验同族(Beta-Binomial 等);先验=伪计数。
MAP
后验众数——先验化的 MLE;均匀先验时两者重合。
多元正态
N(μ,Σ);等密度椭球;条件分布仍正态(线性修正公式)。
马氏距离
计入协方差的离群度量 (x−μ)ᵀΣ⁻¹(x−μ)。
熵
H=−Σp log p——不确定性的比特刻度;均匀最大、确定最小。
KL 散度
D(P‖Q)=Σp log(p/q)≥0;非对称非距离。
交叉熵
H(P,Q)=H(P)+D(P‖Q);分类损失=负对数似然。
互信息
I(X;Y)=D(P(X,Y)‖P_X P_Y)——知道 Y 消除的 X 不确定性。
马尔可夫链
下一步只依赖当前状态的随机过程(转移矩阵 P)。
平稳分布
πP=π;遍历链从任何初值收敛到它。
细致平衡
πᵢp_{ij}=πⱼp_{ji}——MCMC 的构造原理。
蒙特卡洛方法
随机采样均值逼近期望/积分;误差∝1/√n(与维度无关)。
方差缩减
对偶变量/控制变量/重要性采样——降估计量方差。
逆变换采样
X=F⁻¹(U)——单调 CDF 的精确采样法。
拒绝采样
包络 Mq 下接受-拒绝;效率=1/M。
重要性采样
从 q 采样按 p/q 加权估计期望;q 必须覆盖 p 尾部。
MCMC
以目标为平稳分布的马尔可夫链采样(MH/Gibbs)。
辛普森悖论
分层与聚合结论相反——混杂变量的权重翻转。
赌徒谬误
独立事件"该反转了"的错觉(LLN 靠稀释不靠补偿)。
基率忽视
忽略人群基数只看检测准确率(贝叶斯定理的解药)。
合取谬误
P(A∩B)>P(A) 的直觉违规(细节越多概率越低)。
生日悖论
23 人 50% 撞生日;哈希碰撞约 2^{b/2} 次。
幸存者偏差
样本被"是否出现"筛选后的系统性误导。
p-hacking
多次尝试/选择性报告直到显著——复现危机的核心机制。
ASA 六原则
美国统计学会关于 p 值正确使用与限制的声明(2016)。