中文

基于高阶 MPI-Kokkos 加速的流体求解器性能评估

分布式、并行与集群计算 2025-10-08 v1

摘要

本文讨论了在现代高性能计算架构上求解流体动力学问题的现代数值方案的性能。我们的编码实现了一个空间节点不可连续 Galerkin 方案,我们测试了最高可达八阶收敛性。该方案在时间上与最高可达六阶的 Runge-Kutta 方法相耦合。该代码求解一、二、三维的线性对流方程以及等温 Euler 方程。为了针对包含众多核心中央处理器和诸如图形处理单元等加速器的现代硬件,我们使用 Kokkos 库结合消息传递接口,在各种 GPU 系统上运行单一源代码。我们发现,阶数越高,代码运行速度就越快。八阶仿真以更少的计算时间即可实现给定的全局误差,相较于三阶或四阶仿真更为高效。RK 方案对代码性能的影响较小,经典的四阶方案通常是良好的选择。该代码在所有考虑的 GPU 上性能表现非常出色。许多 CPU 的性能也非常优秀,在使用 MPI 的情况下实现了完美的弱扩展,扩展至数百个 CPU 核心。我们指出,小规模仿真在 CPU 上比在 GPU 上更快,而 GPU 在涉及超过 10710^7 自由度(约等于 310023100^2 网格点)的仿真中显著优于 CPU。就数值仿真的环境影响而言,我们估计大规模仿真中 GPU 比 CPU 更省能,而在小规模仿真中则更耗能。我们观察到,随着 GPU 的更加现代化,为其提供有效能的网格规模也随之增大。这导致了反弹效应,因为更大的仿真需要更长的计算时间,从而消耗更多能源,这并未被新型 GPU 的能效提升所抵消。

关键词

引用

@article{arxiv.2510.05254,
  title  = {Performance of a high-order MPI-Kokkos accelerated fluid solver},
  author = {Filipp Sporykhin and Holger Homann},
  journal= {arXiv preprint arXiv:2510.05254},
  year   = {2025}
}

备注

12 pages, 16 figures. submitted to Computer Physics Communications