中文

面向大型时空有序数据快速贝叶斯推断的两阶段MCMC及其在美国干旱中的应用

统计方法学 2025-06-02 v1 应用统计

摘要

在拟合时空模型时,高维时空数据带来了已知的计算挑战。此类数据在空间的多个维度以及时间上均表现出依赖性,且很容易涉及数十万个观测值。许多时空模型会在所有观测值之间产生依赖结构,且只能在巨大的计算成本下进行拟合,这些成本源于稠密矩阵求逆、高维参数空间、马尔可夫链蒙特卡洛中较差的混合,或由于模型拟合过程中任何地方均缺乏独立性而无法利用并行计算。当响应变量为有序变量时,尤其是当有序类别的数量增加时,这些计算挑战会进一步加剧。一些时空模型通过对模型进行过度限制的简化来实现对大型数据集的计算可行性,而我们在此力求避免这种情况。在本文中,我们展示了一种两阶段算法,用于在响应变量为有序变量时将贝叶斯时空模型拟合到大型数据集。第一阶段在空间上对位置进行独立建模,捕捉时间依赖性,且可并行运行。第二阶段从第一阶段的后验分布中进行重采样,其接受概率的计算旨在施加完整时空模型的空间依赖性。其结果是快速的贝叶斯推断,从完整的时空后验中进行采样,并且即使对于大型数据集在计算上也是可行的。我们量化了该方法所实现的显著计算增益,并证明了与成本更高的单阶段模型拟合相比,其后验分布得到了保留。我们将该方法应用于美国的大型时空干旱数据集,该数据集对于许多现有的时空方法而言过于庞大。

关键词

引用

@article{arxiv.2505.24594,
  title  = {Two-stage MCMC for Fast Bayesian Inference of Large Spatio-temporal Ordinal Data, with Application to US Drought},
  author = {Staci Hepler and Rob Erhardt},
  journal= {arXiv preprint arXiv:2505.24594},
  year   = {2025}
}