维持 Exascale 性能:来自 HPL 和 HPL-MxP 在 Aurora 上的经验教训
分布式、并行与集群计算
2026-04-13 v1
摘要
在生产环境中维持 Exascale 性能需要在真实部署约束下才能显现的工程选择和操作实践,这些选择需要跨系统层次协调。本文报告了在 Aurora 上运行 HPL 和 HPL-MxP 的三轮连续 campaign 的经验。Aurora 从 5,439 个节点上的 0.585EF/s progresses to 9,234 个节点上的 1.01EF/s(FP64 HPL),而 HPL-MxP 达到 11.64EF/s,较 FP64 快 11.5 倍,主要得益于混合精度算术和 Intel AMX 加速。我们识别并按在生产规模下的角色对系统级选择进行归类,包括确定性局域性感知资源映射、显式 CPU-GPU 流水线、混合精度编排,以及在规模化后引入的混合 P2P/集合弹性策略。虽然一些观察是 Aurora 特定的,但更广泛的教训可能适用于极端规模的紧密耦合异构系统。
引用
@article{arxiv.2604.09517,
title = {Sustaining Exascale Performance: Lessons from HPL and HPL-MxP on Aurora},
author = {Kazushige Goto and Huda Ibeid and Kalyan Kumaran and Servesh Muralidharan and Anthony-Trung Nguyen and Aditya Nishtala},
journal= {arXiv preprint arXiv:2604.09517},
year = {2026}
}