跳转至

统计计算

统计计算研究怎样把“分布、期望、积分、估计量和后验”转化为可执行算法。它关注的不只是算出一个数,还包括随机误差、数值稳定性、计算成本和结果诊断。

阅读总复习 查看 R 脚本

专题结构

本专题由两类材料组成:

  • 统计计算总复习:按方法整理公式、最小代码模板、常见变式与易错点;
  • R 脚本索引:保存课程 Ch1-Ch7 的完整代码和配套数据,便于实际运行与比较。
模块 核心问题 总复习 配套代码
R 基础 怎样组织数据、读写文件并进行初步可视化? §1 Ch1
随机变量生成 只有均匀随机数时,怎样生成目标分布? §2-§4 Ch2
Monte Carlo 积分 怎样用样本均值估计积分或期望? §5 Ch3
方差缩减 怎样在相同样本量下获得更小误差? §6 Ch3
统计模拟 怎样评估 MSE、覆盖率、错误率和功效? §7 Ch4
重采样 不知道估计量分布时,怎样估计偏差和标准误? §8 Ch5
数值方法与 MLE 似然方程没有解析解时怎样求根和优化? §9 Ch6
MCMC 无法直接从目标分布抽样时怎样构造马尔科夫链? §10 Ch7

一条贯穿全课的主线

许多统计计算方法都可以写成“用可计算对象近似不可直接计算对象”。例如,若目标是

\[ \theta=\mathbb E_f[h(X)] =\int h(x)f(x)\,dx, \]

直接积分困难时,可以从 \(f\) 抽取样本并使用

\[ \widehat\theta_N=\frac1N\sum_{i=1}^{N}h(X_i). \]

随后必须继续问:

  1. 能否直接从 \(f\) 抽样?若不能,需要逆变换、接受-拒绝或 MCMC;
  2. \(\widehat\theta_N\) 的方差有多大?能否用控制变量、重要抽样等方法降低;
  3. 有限样本下误差如何估计?可以使用中心极限定理、Bootstrap 或 Jackknife;
  4. 算法是否真正收敛?数值求根要检查残差,MCMC 要检查轨迹、自相关和有效样本量。

因此,随机数生成、Monte Carlo、Bootstrap、数值优化和 MCMC 并不是互不相关的章节,而是同一条计算链上的不同部件。

推荐学习顺序

R 基础
  -> 随机变量生成
  -> Monte Carlo 积分
  -> 方差缩减与统计模拟
  -> Bootstrap / Jackknife
  -> 数值求根与 MLE
  -> MCMC

第一次阅读时,建议先看总复习中每节的“适用场景”和“最小代码模板”,再运行脚本索引中的代表例子。理解方法后,再进入同章课程练习,而不是从头逐行执行所有文件。

暂未纳入主线的内容

变分推断、EM、高维稀疏计算等主题与统计计算密切相关,但桌面课程脚本和当前总复习没有形成完整对应,因此暂不在本专题中假装已经覆盖。后续补充时应分别增加理论说明、可运行脚本和验证案例。