基于 ExaGeoStatR 的大规模环境数据科学
分布式、并行与集群计算
2022-10-19 v3 统计计算
摘要
在高斯过程计算中,并行计算对于避免与大规模环境数据科学应用相关的计算和内存限制是必要的。高斯对数似然函数的求值需要 O(n^2) 的存储和 O(n^3) 的操作,其中 n 为地理位置的数量。因此,使用大量位置计算对数似然函数需要利用现有并行计算硬件系统(如共享内存、可能配备 GPU 的系统以及分布式内存系统)的能力来解决这一计算复杂度。在本文中,我们提倡使用 ExaGeoStatR,一个用于 R 语言中亿亿次级地统计学的包,它支持在多种并行架构上精确最大似然函数的并行计算。ExaGeoStatR 中的并行化依赖于将对数似然函数中的数值线性代数操作分解为一组任务,并将其提供给基于任务的编程模型。该包可通过 R 环境直接在并行系统上使用。目前,ExaGeoStatR 支持多种最大似然计算变体,如精确、对角超块(DST)、块低秩(TLR)近似和混合精度(MP)。ExaGeoStatR 还提供一个工具用于模拟大规模合成数据集。这些数据集有助于评估最大对数似然近似方法的不同实现。在此,我们通过阐述其实现细节、分析其在各种并行架构上的性能以及使用多达 250K 观测的合成数据集评估其准确性来演示 ExaGeoStatR。我们提供了一个动手教程来分析海表温度真实数据集。性能评估涉及与流行包 geoR 和 fields 在精确似然评估方面的比较。
引用
@article{arxiv.1908.06936,
title = {Large-scale Environmental Data Science with ExaGeoStatR},
author = {Sameh Abdulah and Yuxiao Li and Jian Cao and Hatem Ltaief and David E. Keyes and Marc G. Genton and Ying Sun},
journal= {arXiv preprint arXiv:1908.06936},
year = {2022}
}