Stream-K:面向GPU上稠密矩阵-矩阵乘法的以工作为中心并行分解
数据结构与算法
2023-01-11 v1 分布式、并行与集群计算
摘要
我们提出Stream-K,一种用于稠密线性代数中矩阵乘法(GEMM)及相关计算的以工作为中心的并行化方法。当代分解主要基于分块,而我们的方法通过将聚合内循环迭代的均匀份额划分给物理处理单元来运作。这提供了近乎完美的计算资源利用率,无论任何给定问题的输出分块在底层处理单元上的量化效率如何。在GPU处理器上,我们对GEMM的Stream-K并行化相较CUTLASS和cuBLAS等最先进数学库,在32,824个GEMM问题规模上实现了最高达14和6.7的峰值加速,以及更高且更一致的平均性能表现。此外,我们在每种浮点精度下仅用单一分块尺寸配置即达成该性能,而当今数学库采用复杂的核选择启发式方法从大量核变体中进行选择。
引用
@article{arxiv.2301.03598,
title = {Stream-K: Work-centric Parallel Decomposition for Dense Matrix-Matrix Multiplication on the GPU},
author = {Muhammad Osama and Duane Merrill and Cris Cecka and Michael Garland and John D. Owens},
journal= {arXiv preprint arXiv:2301.03598},
year = {2023}
}
备注
This work previously appeared in the author's PhD dissertation, available at arXiv:2212.08964