矩阵乘法算法的强可扩展性与内存无关的通信下界
数据结构与算法
2012-02-16 v1 计算复杂性
分布式、并行与集群计算
数值分析
组合数学
数值分析
摘要
如果一个并行算法在P个处理器上的运行时间(包括所有通信开销)与1/P成线性关系,则该算法具有完美的强可扩展性。具有完美强可扩展性的分布式内存并行矩阵乘法算法直到最近才被发现。一种基于经典矩阵乘法(Solomonik and Demmel, 2011),另一种基于Strassen快速矩阵乘法(Ballard, Demmel, Holtz, Lipshitz, and Schwartz, 2012)。两种算法都能完美扩展,但仅限于处理器数量达到某个上限,超过该上限后处理器间通信不再可扩展。我们得到了经典和基于Strassen的分布式内存矩阵乘法算法的内存无关通信开销下界。这些下界意味着,没有任何经典或基于Strassen的并行矩阵乘法算法能够超越上述两种算法已经达到的范围实现完美强可扩展性。这些内存无关下界和强可扩展性下界可推广到其他算法。
关键词
引用
@article{arxiv.1202.3177,
title = {Strong Scaling of Matrix Multiplication Algorithms and Memory-Independent Communication Lower Bounds},
author = {Grey Ballard and James Demmel and Olga Holtz and Benjamin Lipshitz and Oded Schwartz},
journal= {arXiv preprint arXiv:1202.3177},
year = {2012}
}
备注
4 pages, 1 figure