中文

分布式 GPU 上的批处理矩阵运算及其在理论物理中的应用

分布式、并行与集群计算 2022-03-18 v1

摘要

在许多线性代数函数中,最重要且最常用的运算之一是矩阵-矩阵乘法(GEMM),它也是许多科学代码获得高性能的关键组成部分。它是一个计算密集型函数,需要 O(n3)O(n^3) 次运算,其高计算强度使其非常适合用 GPU 大幅加速。如今,许多研究问题需要求解大量相对较小的 GEMM 运算,这些运算无法利用整个 GPU。为克服这一瓶颈,已开发出特殊函数将多个 GEMM 运算打包为一个并在 GPU 上同时计算,称为批处理运算。在本研究工作中,我们提出了一种基于将多个 GEMM 运算链接到 MPI 秩然后将多个 MPI 秩绑定到单个 GPU 的不同方法。为提高 GPU 利用率,增加了更多 MPI 秩(即 GEMM 运算)。我们在理论物理领域实现并测试了该方法,通过量子自旋链的模拟退火蒙特卡洛模拟计算纠缠性质。针对该特定用例,我们能够模拟大得多的自旋系统,并实现相比纯并行 CPU 版本最高 35×35\times 的加速。

关键词

引用

@article{arxiv.2203.09353,
  title  = {Batched matrix operations on distributed GPUs with application in theoretical physics},
  author = {Nenad Mijić and Davor Davidović},
  journal= {arXiv preprint arXiv:2203.09353},
  year   = {2022}
}