中文

通过算法优化与 NCCL 库推进分布式多 GPU ChASE 库

分布式、并行与集群计算 2023-09-28 v1 计算工程、金融与科学

摘要

随着超级计算机规模扩大并配备强大的图形处理单元(GPU),传统的直接特征求解器由于通信与同步需求难以跟上硬件演进并高效扩展。相反,子空间特征求解器,如切比雪夫加速子空间特征求解器(ChASE),结构更简单,能够克服通信与同步瓶颈。ChASE 是一种现代子空间特征求解器,利用切比雪夫多项式加速计算稠密 Hermitian 特征问题的极端特征对。本工作中,我们展示了如何通过重新设计其内存布局、引入新颖并行化方案、为其某一内部模块切换至性能更优的通信避免算法,以及用厂商优化的 NCCL 库替代 MPI 库来改进 ChASE。所得库可处理规模达 N=O(106)N=\mathcal{O}(10^6) 的稠密问题,并能在位于 Jülich 超级计算中心的 JUWELS Booster 的全部 900 个节点(每个节点由 4×\timesA100 NVIDIA GPU 驱动)上轻松扩展。

关键词

引用

@article{arxiv.2309.15595,
  title  = {Advancing the distributed Multi-GPU ChASE library through algorithm optimization and NCCL library},
  author = {Xinzhe Wu and Edoardo Di Napoli},
  journal= {arXiv preprint arXiv:2309.15595},
  year   = {2023}
}

备注

8 pages, accepted at the proceedings of ScalAH23 workshop within the SC23 conference