面向分布式量子蒙特卡洛求解器基于 GPU RDMA 环抽象的内存缩减
分布式、并行与集群计算
2021-05-14 v2 材料科学
强关联电子
超导电性
摘要
在领先计算设施上运行的科学应用常面临因内存限制(内存受限应用)而无法将前沿科学案例放入加速器设备的挑战。在这项工作中,作者研究了一个此类美国能源部任务关键的凝聚态物理应用——动力学团簇近似(DCA++),本文讨论了如何通过提出一种有效的“全对全”通信方法——环通信算法,成功缓解设备内存受限挑战。该实现利用 GPU 上的加速和远程直接内存访问(RDMA)实现 GPU 间快速数据交换。此外,环算法通过子环通信器与多线程支持分别进行了优化,以进一步降低通信开销并暴露更多并发性。计算与通信也通过使用 Autonomic Performance Environment for Exascale(APEX)性能分析工具进行了分析,本文进一步讨论了环算法实现的性能权衡。环算法的内存分析表明,每个 GPU 上最耗内存的数据结构的分配大小现已缩减为原始大小的 1/p,其中 p 为环通信器中的 GPU 数量。通信分析表明,分布式量子蒙特卡洛执行时间随子环大小线性增长,且通过网络接口连接器传递消息的开销可能成为限制因素。
引用
@article{arxiv.2105.00027,
title = {Memory Reduction using a Ring Abstraction over GPU RDMA for Distributed Quantum Monte Carlo Solver},
author = {Weile Wei and Eduardo D'Azevedo and Kevin Huck and Arghya Chatterjee and Oscar Hernandez and Hartmut Kaiser},
journal= {arXiv preprint arXiv:2105.00027},
year = {2021}
}