中文

重构GROMACS Halo Exchange:基于GPU发起的NVSHMEM提升强规模性能

分布式、并行与集群计算 2025-09-29 v1 性能 计算物理

摘要

分子动力学仿真的求解时间往往需要通过强规模实现,因为问题规模固定。GROMACS高度依赖时延敏感,峰值迭代速率在亚毫秒级,使得在异构超级计算机上实现可扩展性具有挑战性。MPI的CPU中心化本质在GPU驻留应用的关键路径上引入额外时延,阻碍GPU利用率和可扩展性。为此,我们提出一种基于NVSHMEM的GPU核发起式GROMACS域分解halo交换算法重构方案。经过高度优化的GPU核函数融合数据打包与通信,利用硬件延迟隐藏实现细粒度重叠。我们跨越重叠数据转发通信阶段采用核函数融合,并利用NVLink上的异步拷贝引擎以优化时延与带宽。我们的GPU驻留方案大幅提升通信-计算重叠,使GROMACS在NVLink上的强规模性能提升最高达1.5倍(节点内),跨节点提升最高达2倍,NVLink+InfiniBand跨节点提升最高达1.3倍。这表明GPU发起式通信对广泛的时延敏感应用实现强规模具有深远益处。

关键词

引用

@article{arxiv.2509.21527,
  title  = {Redesigning GROMACS Halo Exchange: Improving Strong Scaling with GPU-initiated NVSHMEM},
  author = {Mahesh Doijade and Andrey Alekseenko and Ania Brown and Alan Gray and Szilárd Páll},
  journal= {arXiv preprint arXiv:2509.21527},
  year   = {2025}
}

备注

17 pages, 8 figures, submitted to PAW-ATM Workshop, SC 2025