TSM2X:GPU 上高性能瘦高矩阵-矩阵乘法
分布式、并行与集群计算
2021-02-19 v5
摘要
线性代数运算已广泛应用于大数据分析与科学计算。已有许多工作致力于在具有规则形状输入的 GPU 上优化线性代数运算。然而,当输入非规则形状时,极少有工作关注对 GPU 资源的充分利用。当前的优化未考虑充分利用内存带宽与计算能力;因此只能达到次优性能。本文中,我们提出两种高效算法——TSM2R 与 TSM2L——用于 GPU 上两类瘦高矩阵-矩阵乘法。二者均着眼于优化至少一个输入矩阵为瘦高矩阵的线性代数运算。具体而言,TSM2R 设计用于大规则形状矩阵乘以瘦高矩阵,而 TSM2L 设计用于瘦高矩阵乘以小规则形状矩阵。我们实现了所提算法并在若干现代 NVIDIA GPU 微架构上测试。实验表明,相较于当前最优工作:(1)当规则形状矩阵尺寸相对较大或中等时,TSM2R 将计算加速 1.1x~3x,并将内存带宽利用率与计算能力利用率分别提升 8%~47.6% 与 7%~37.3%;(2)当规则形状矩阵尺寸相对较小时,TSM2L 将计算加速 1.1x~3.5x,并将内存带宽利用率提升至多 55%。
引用
@article{arxiv.2002.03258,
title = {TSM2X: High-Performance Tall-and-Skinny Matrix-Matrix Multiplication on GPUs},
author = {Cody Rivera and Jieyang Chen and Nan Xiong and Shuaiwen Leon Song and Dingwen Tao},
journal= {arXiv preprint arXiv:2002.03258},
year = {2021}
}
备注
17 pages, 14 figures, published in JPDC