中文

面向百亿亿次加速架构的高性能Linpack优化

分布式、并行与集群计算 2023-04-21 v1 数值分析 数值分析

摘要

我们详述了rocHPL中所做的性能优化,rocHPL是AMD面向如Frontier超级计算机等专为百亿亿次系统设计的加速节点架构的High-Performance Linpack(HPL)基准测试开源实现。该实现通过高度优化的线性代数库利用节点上的高吞吐GPU加速器,并利用整个CPU插槽执行对延迟敏感的分解阶段。我们详述了若干新颖性能改进,例如在CPU上计算面板分解阶段的多线程方法、节点上进程间CPU核心的时间共享,以及若干隐藏MPI通信的优化。我们给出了该HPL基准测试实现在橡树岭国家实验室Frontier早期访问集群单节点及扩展至多节点上的一些性能结果。

关键词

引用

@article{arxiv.2304.10397,
  title  = {Optimizing High-Performance Linpack for Exascale Accelerated Architectures},
  author = {Noel Chalmers and Jakub Kurzak and Damon McDougall and Paul T. Bauman},
  journal= {arXiv preprint arXiv:2304.10397},
  year   = {2023}
}