在消费级显卡上加速 GENGA N体积分器
地球与行星天体物理
2023-09-18 v1 天体物理仪器与方法
分布式、并行与集群计算
计算物理
摘要
GPU 计算因其单卡的计算潜力而广受欢迎。N体积分器 GENGA 正是为此而构建,但由于消费级 GPU 的截断双精度(FP64)性能,其在这些显卡上遭受性能损失。我们旨在通过利用消费级显卡的高单精度性能(FP32)来加速 GENGA。我们修改了 GENGA 以能够在 FP32 精度下计算天体间的长距离力,并通过 5 个实验进行了测试。我们使用 6600 个星子的相似初始条件在 FP32 和 FP64 精度下运行了模拟。我们还运行了以下模拟:i) 以星子和行星胚胎混合物开始,ii) 星子驱动的巨行星迁移,以及 iii) 带气体盘的类地行星形成。其次,我们使用 40 000 个星子的相同初始条件,在多种消费级和 Tesla GPU 上分别采用 FP32 和 FP64 精度力运行模拟,以衡量 FP32 计算带来的性能提升。在 FP32 或 FP64 精度下运行没有可归因于力方案而非随机效应的统计差异。两种精度下的能量不确定性几乎相同。然而,使用 FP32 而非 FP64 精度长距离力时的角动量不确定性大约高两个数量级,但仍非常低。在消费级显卡上以单精度运行模拟将运行时间减少了三倍,并达到 Tesla A100 GPU 的三倍以内。额外的调优在所有类型显卡上进一步将模拟加速了两倍。在使用消费级 GPU 时,GENGA 中计算单精度长距离力的选项以微小的精度损失大幅提升了性能。这还有减少能耗的额外环境效益。
引用
@article{arxiv.2309.08217,
title = {Speeding up the GENGA N-body integrator on consumer-grade graphics cards},
author = {R. Brasser and S. L. Grimm and P. Hatalova and J. G. Stadel},
journal= {arXiv preprint arXiv:2309.08217},
year = {2023}
}
备注
Accepted for publication in Astronomy & Astrophysics