中文

极端规模下避免通信与受限内存的稀疏矩阵-矩阵乘法

分布式、并行与集群计算 2020-10-19 v1

摘要

稀疏矩阵-矩阵乘法(SpGEMM)是各类图算法、科学计算与机器学习算法中广泛使用的核心算子。本文考虑在数十万个处理器上执行、在输出矩阵中生成数万亿个非零元的 SpGEMM。在此极端规模下的分布式 SpGEMM 面临两个关键挑战:(1)高通信成本;(2)生成输出所需内存不足。我们通过一种集成了避免通信与内存受限的 SpGEMM 算法来应对这些挑战,该算法可扩展至 262,144 个核心(超过 100 万个硬件线程),并能在输入与部分输出可放入聚合内存的前提下,乘任意规模的稀疏矩阵。在 Cray XC40 超级计算机上,当核心数从 16,384 增至 262,144 时,这一新 SpGEMM 算法在乘大规模蛋白质相似性矩阵时运行速度快了 10 倍。

关键词

引用

@article{arxiv.2010.08526,
  title  = {Communication-Avoiding and Memory-Constrained Sparse Matrix-Matrix Multiplication at Extreme Scale},
  author = {Md Taufique Hussain and Oguz Selvitopi and Aydin Buluç and Ariful Azad},
  journal= {arXiv preprint arXiv:2010.08526},
  year   = {2020}
}

备注

14 pages, 15 figures