中文

启用 OpenACC 的 Nek5000 在多个基于 GPU 的 HPC 系统上的强扩展性

分布式、并行与集群计算 2021-11-05 v3

摘要

我们给出了高阶谱元流体动力学求解器 Nek5000 的 OpenACC 加速实现在强并行扩展性上的新结果。所考虑的测试用例为直管中充分发展湍流的直拉模拟(direct numerical simulation),基于摩擦速度与管半径的两个不同雷诺数 Reτ=360Re_\tau=360Reτ=550Re_\tau=550。强扩展性在多个支持 GPU 的 HPC 系统上测试,包括瑞士 Piz Daint 系统、TACC 的 Longhorn、Jülich 的 JUWELS Booster 以及瑞典的 Berzelius。性能结果表明,在这些不同系统上,与 CPU 版本相比,GPU 加速版本可实现 3-5 倍的加速。在 JUWELS Booster 系统上,对于 Reτ=550Re_\tau=550 算例,将 GPU 数量从 64 增加到 512 时,20 个时间步的运行时间从 43.5 秒减少到 13.2 秒。这说明了 GPU 加速版本具备高吞吐量的潜力。同时,GPU 的强扩展性极限显著更大,约为每秩 200050002000-5000 个单元;而 CPU 秩约为 5010050-100

关键词

引用

@article{arxiv.2109.03592,
  title  = {Strong Scaling of OpenACC enabled Nek5000 on several GPU based HPC systems},
  author = {Jonathan Vincent and Jing Gong and Martin Karp and Adam Peplinski and Niclas Jansson and Artur Podobas and Andreas Jocksch and Jie Yao and Fazle Hussain and Stefano Markidis and Matts Karlsson and Dirk Pleiter and Erwin Laure and Philipp Schlatter},
  journal= {arXiv preprint arXiv:2109.03592},
  year   = {2021}
}

备注

9 pages, 8 figures. Submitted to HPC-Asia 2022 conference, updated to address reviewers comments