一个重要的聚变 HPC 代码基准的单节点与多节点性能比较
分布式、并行与集群计算
2022-07-12 v1 等离子体物理
摘要
聚变模拟传统上需要使用领先规模的的高性能计算(HPC)资源以取得物理学进展。多 GPU 计算节点在算力和内存容量上的显著提升,使得一些曾经需要多节点设置的问题现在也能在单节点上求解。在可能的情况下,互连带宽的提升可带来数量级更高的科学吞吐率,尤其对于通信密集型应用。本文分析了聚变模拟工具 CGYRO 的性能,该工具是一个为碰撞、电磁、多尺度模拟设计并优化的欧拉回转动力学湍流求解器,被广泛用于聚变研究界。由于问题性质,应用必须整体处理一个大型多维计算网格,需要在计算进程间频繁交换大量数据。我们特别表明,中等规模的 nl03 基准 CGYRO 模拟可在配备 16 块 A100 GPU 的单个 Google Cloud 实例上以可接受速度运行,优于 8 个 NERSC Perlmutter Phase1 节点、16 个 ORNL Summit 节点和 256 个 NERSC Cori 节点。从多节点迁移到单节点 GPU 设置,我们使用不到一半数量的 GPU 便获得了可比的模拟时间。然而,更大的基准问题由于 GPU 内存容量需求仍需要多节点 HPC 设置,因为撰写本文时没有任何供应商提供具备足够 GPU 内存设置的节点。即将推出的外部 NVSWITCH 则有望为最多 256 块 NVIDIA GPU 提供近乎等效的解决方案。
引用
@article{arxiv.2205.09682,
title = {Comparing single-node and multi-node performance of an important fusion HPC code benchmark},
author = {Emily A. Belli and Jeff Candy and Igor Sfiligoi and Frank Würthwein},
journal= {arXiv preprint arXiv:2205.09682},
year = {2022}
}
备注
6 pages, 1 table, 1 figure, to be published in proceedings of PEARC22