面向百亿亿次加速架构的高性能Linpack优化
分布式、并行与集群计算
2023-04-21 v1 数值分析
数值分析
摘要
我们详述了rocHPL中所做的性能优化,rocHPL是AMD面向如Frontier超级计算机等专为百亿亿次系统设计的加速节点架构的High-Performance Linpack(HPL)基准测试开源实现。该实现通过高度优化的线性代数库利用节点上的高吞吐GPU加速器,并利用整个CPU插槽执行对延迟敏感的分解阶段。我们详述了若干新颖性能改进,例如在CPU上计算面板分解阶段的多线程方法、节点上进程间CPU核心的时间共享,以及若干隐藏MPI通信的优化。我们给出了该HPL基准测试实现在橡树岭国家实验室Frontier早期访问集群单节点及扩展至多节点上的一些性能结果。
引用
@article{arxiv.2304.10397,
title = {Optimizing High-Performance Linpack for Exascale Accelerated Architectures},
author = {Noel Chalmers and Jakub Kurzak and Damon McDougall and Paul T. Bauman},
journal= {arXiv preprint arXiv:2304.10397},
year = {2023}
}