中文

基于传播阻塞的带宽优化稀疏矩阵-矩阵乘法并行算法

分布式、并行与集群计算 2020-02-27 v1

摘要

稀疏矩阵-矩阵乘法(SpGEMM)是各种图算法、科学计算和机器学习算法中广泛使用的核心算子。众所周知,SpGEMM 是一种访存受限操作,其峰值性能预期受内存带宽限制。然而,现有算法未能饱和内存带宽,导致在 Roofline 模型下性能欠佳。本文基于内存访问模式对现有 SpGEMM 算法进行刻画,并推导出 SpGEMM 性能的实用下界和上界。随后,我们基于外积矩阵乘法开发了一种 SpGEMM 算法。该新开发的算法称为 PB-SpGEMM,通过采用传播阻塞(propagation blocking)技术以及执行缓存内排序与归并来饱和内存带宽。对于许多实际矩阵,在现代多核处理器上,PB-SpGEMM 比最先进的堆(heap)和哈希(hash)SpGEMM 算法快 20%–50%。最重要的是,PB-SpGEMM 达到了 Roofline 模型预测的性能,且其性能相对于矩阵规模和稀疏度保持稳定。

关键词

引用

@article{arxiv.2002.11302,
  title  = {Bandwidth-Optimized Parallel Algorithms for Sparse Matrix-Matrix Multiplication using Propagation Blocking},
  author = {Zhixiang Gu and Jose Moreira and David Edelsohn and Ariful Azad},
  journal= {arXiv preprint arXiv:2002.11302},
  year   = {2020}
}