中文

MFC 可压缩多相流求解器在 AMD 和 NVIDIA GPU 上的 OpenACC 卸载

流体动力学 2025-05-20 v1 数学软件 计算物理

摘要

GPU 是最新一代超级计算机的核心。我们通过 OpenACC 在 NVIDIA 和 AMD Instinct GPU 上高效加速了可压缩多相流求解器。优化是通过指定指令子句 'gang vector' 和 'collapse' 来实现的。通过将用户自定义类型打包成合并的多维数组以及通过元编程进行手动内联,进一步实现了六倍和十倍的加速。额外的优化在 Frontier 上实现了七倍的数组打包加速和三十倍的选择性内核加速。在扩展到 Summit 的 50% 和 Frontier 的 95% 时,观察到 97% 和 95% 的弱扩展效率。在 V100 和 MI250X 硬件上将设备数量增加 8 倍和 16 倍时,观察到 84% 和 81% 的强扩展效率。当使用 GPU 感知 MPI 进行通信时,AMD MI250X 的强扩展效率在设备数量增加 16 倍时提高至 92%。

关键词

引用

@article{arxiv.2409.10729,
  title  = {OpenACC offloading of the MFC compressible multiphase flow solver on AMD and NVIDIA GPUs},
  author = {Benjamin Wilfong and Anand Radhakrishnan and Henry A. Le Berre and Steve Abbott and Reuben D. Budiardja and Spencer H. Bryngelson},
  journal= {arXiv preprint arXiv:2409.10729},
  year   = {2025}
}

备注

11 pages, 9 figures, 6 listings, WACCPD at SC24