中文

面向大规模可移植性:GPU 加速浅水求解器的跨架构性能评估

分布式、并行与集群计算 2025-11-04 v1 性能

摘要

当前气候变化在数值建模领域提出了一大挑战,由于其复杂的多尺度动力学。在水文学建模中,对高分辨率、实时仿真日益增长的需求导致 GPU 加速平台和性能可移植编程框架如 Kokkos 的采用。在本工作中,我们对 SERGHEI-SWE 求解器进行了全面的性能研究,这是一个浅水方程代码,跨越四个最先进的异构 HPC 系统:Frontier(AMD MI250X)、JUWELS Booster(NVIDIA A100)、JEDI(NVIDIA H100)和 Aurora(Intel Max 1550)。我们评估了强缩放至 1024 个 GPU 和弱缩放至 2048 个 GPU 以上的规模,显示出与速度提升 32 倍和效率超过 90% 相当的一致性可扩展性。Roofline 分析揭示了内存带宽是主要的性能瓶颈,关键求解器内核位于内存受限区域。为评估性能可移植性,我们应用了基于谐和算术均值的度量标准,并变化问题规模。结果表明,虽然 SERGHEI-SWE 在经调校的规模下(<70%)实现了跨设备的可移植性,但求解器内部仍有内核优化的空间,通过使用 Kokkos 团队和特定于架构的可调参数实现更细粒度的控制。这些发现将 SERGHEI-SWE 定位为一个稳健、可扩展且可移植的大规模地理物理应用仿真工具,旨在应对不断演变的 HPC 架构,潜在提升其性能。

关键词

引用

@article{arxiv.2511.01001,
  title  = {Towards Portability at Scale: A Cross-Architecture Performance Evaluation of a GPU-enabled Shallow Water Solver},
  author = {Johansell Villalobos and Daniel Caviedes-Voullième and Silvio Rizzi and Esteban Meneses},
  journal= {arXiv preprint arXiv:2511.01001},
  year   = {2025}
}

备注

Conference: SBAC-PAD 2025