中文

GSoFa:GPU 上可扩展的稀疏符号 LU 分解

分布式、并行与集群计算 2021-05-11 v4

摘要

将矩阵 A 分解为下三角矩阵 L 与上三角矩阵 U(即 LU 分解)是数值线性代数中的基本运算。对于稀疏矩阵,LU 分解常在 L 与 U 因子中引入比原矩阵更多的非零元。需要符号分解步骤来识别 L 与 U 矩阵的非零结构。受图形处理器(GPU)巨大潜力的吸引,已有大量工作将各类 LU 分解步骤部署到 GPU 上,但据我们所知,符号分解除外。本文介绍 gSoFa,首个基于 GPU 的符号分解设计,具有如下三项优化以实现 GPU 上非对称模式稀疏矩阵的可扩展 LU 符号分解。首先,我们提出一种新颖的细粒度并行符号分解算法,非常契合 GPU 的单指令多线程(SIMT)架构。其次,我们将超节点检测定制为 SIMT 友好过程,并努力平衡工作负载、最小化通信并在超节点检测期间饱和 GPU 计算资源。第三,我们引入三管齐下的优化以缓解多源并发符号分解所面临的过度空间消耗问题。综上,gSoFa 在 1 至 44 个 Summit 节点(6 至 264 个 GPU)上实现最高 31 倍加速,并平均优于最先进 CPU 项目 5 倍。值得注意的是,gSoFa 在 Summit 中还达到了 V100 GPU 峰值内存吞吐量的最高 47%。

关键词

引用

@article{arxiv.2007.00840,
  title  = {GSoFa: Scalable Sparse Symbolic LU Factorization on GPUs},
  author = {Anil Gaihre and Xiaoye S. Li and Hang Liu},
  journal= {arXiv preprint arXiv:2007.00840},
  year   = {2021}
}