中文

并行且高度可移植的 HPC 泊松求解器:基于 alpaka 的预条件 Bi-CGSTAB

分布式、并行与集群计算 2025-03-13 v1

摘要

本文介绍了一种基于预条件双共轭梯度稳定(Bi-CGSTAB)方法的并行且 GPU 加速的泊松求解器的设计、实现和性能分析。该实现利用 MPI 标准实现分布式内存并行,而节点内计算则使用 alpaka 框架处理:这确保了共享内存并行性以及跨不同硬件架构的固有性能可移植性。我们在 CPU 和 GPU(NVIDIA Hopper H100 和 AMD MI250X)上评估了求解器的性能,比较了包括块 Jacobi 和 Chebyshev 迭代在内的不同预条件策略,并分析了单节点和多节点级别的性能。通过强扩展测试并使用 AMD Omnitrace 分析工具对执行效率进行了表征。结果表明,基于 Chebyshev 迭代的无通信预条件子可以使求解器加速六倍以上。该求解器在不同 GPU 架构上表现出相当的性能,与 CPU 实现相比,计算加速比最高可达 50 倍。此外,在多达 64 个设备上,其强扩展效率保持在 90% 以上。

关键词

引用

@article{arxiv.2503.08935,
  title  = {A Parallel and Highly-Portable HPC Poisson Solver: Preconditioned Bi-CGSTAB with alpaka},
  author = {Luca Pennati and Måns I. Andersson and Klaus Steiniger and Rene Widera and Tapish Narwal and Michael Bussmann and Stefano Markidis},
  journal= {arXiv preprint arXiv:2503.08935},
  year   = {2025}
}

备注

10 pages, 8 figures