统计计算
统计计算研究怎样把“分布、期望、积分、估计量和后验”转化为可执行算法。它关注的不只是算出一个数,还包括随机误差、数值稳定性、计算成本和结果诊断。
专题结构
本专题由两类材料组成:
| 模块 | 核心问题 | 总复习 | 配套代码 |
|---|---|---|---|
| R 基础 | 怎样组织数据、读写文件并进行初步可视化? | §1 | Ch1 |
| 随机变量生成 | 只有均匀随机数时,怎样生成目标分布? | §2-§4 | Ch2 |
| Monte Carlo 积分 | 怎样用样本均值估计积分或期望? | §5 | Ch3 |
| 方差缩减 | 怎样在相同样本量下获得更小误差? | §6 | Ch3 |
| 统计模拟 | 怎样评估 MSE、覆盖率、错误率和功效? | §7 | Ch4 |
| 重采样 | 不知道估计量分布时,怎样估计偏差和标准误? | §8 | Ch5 |
| 数值方法与 MLE | 似然方程没有解析解时怎样求根和优化? | §9 | Ch6 |
| MCMC | 无法直接从目标分布抽样时怎样构造马尔科夫链? | §10 | Ch7 |
一条贯穿全课的主线
许多统计计算方法都可以写成“用可计算对象近似不可直接计算对象”。例如,若目标是
\[
\theta=\mathbb E_f[h(X)]
=\int h(x)f(x)\,dx,
\]
直接积分困难时,可以从 \(f\) 抽取样本并使用
\[
\widehat\theta_N=\frac1N\sum_{i=1}^{N}h(X_i).
\]
随后必须继续问:
- 能否直接从 \(f\) 抽样?若不能,需要逆变换、接受-拒绝或 MCMC;
- \(\widehat\theta_N\) 的方差有多大?能否用控制变量、重要抽样等方法降低;
- 有限样本下误差如何估计?可以使用中心极限定理、Bootstrap 或 Jackknife;
- 算法是否真正收敛?数值求根要检查残差,MCMC 要检查轨迹、自相关和有效样本量。
因此,随机数生成、Monte Carlo、Bootstrap、数值优化和 MCMC 并不是互不相关的章节,而是同一条计算链上的不同部件。
推荐学习顺序
第一次阅读时,建议先看总复习中每节的“适用场景”和“最小代码模板”,再运行脚本索引中的代表例子。理解方法后,再进入同章课程练习,而不是从头逐行执行所有文件。
暂未纳入主线的内容
变分推断、EM、高维稀疏计算等主题与统计计算密切相关,但桌面课程脚本和当前总复习没有形成完整对应,因此暂不在本专题中假装已经覆盖。后续补充时应分别增加理论说明、可运行脚本和验证案例。