极端规模下避免通信与受限内存的稀疏矩阵-矩阵乘法
分布式、并行与集群计算
2020-10-19 v1
摘要
稀疏矩阵-矩阵乘法(SpGEMM)是各类图算法、科学计算与机器学习算法中广泛使用的核心算子。本文考虑在数十万个处理器上执行、在输出矩阵中生成数万亿个非零元的 SpGEMM。在此极端规模下的分布式 SpGEMM 面临两个关键挑战:(1)高通信成本;(2)生成输出所需内存不足。我们通过一种集成了避免通信与内存受限的 SpGEMM 算法来应对这些挑战,该算法可扩展至 262,144 个核心(超过 100 万个硬件线程),并能在输入与部分输出可放入聚合内存的前提下,乘任意规模的稀疏矩阵。在 Cray XC40 超级计算机上,当核心数从 16,384 增至 262,144 时,这一新 SpGEMM 算法在乘大规模蛋白质相似性矩阵时运行速度快了 10 倍。
引用
@article{arxiv.2010.08526,
title = {Communication-Avoiding and Memory-Constrained Sparse Matrix-Matrix Multiplication at Extreme Scale},
author = {Md Taufique Hussain and Oguz Selvitopi and Aydin Buluç and Ariful Azad},
journal= {arXiv preprint arXiv:2010.08526},
year = {2020}
}
备注
14 pages, 15 figures