MapReduce 在并行外存模型中的效率
分布式、并行与集群计算
2011-12-19 v1 计算复杂性
摘要
自 2004 年提出以来,MapReduce 框架已成为大规模分布式与并行计算的标准方法之一。与其在实践中的密集应用相比,其理论基础仍然有限,且将 MapReduce 与主要计算模型相提并论的工作尚少。继将 MapReduce 框架与 PRAM 和 BSP 在宏观结构上相关联的先驱工作之后,我们关注该框架自身提供的功能,并在并行外存模型(PEM)中加以考察。为此,我们给出了并行 I/O 复杂度的上下界,对于 shuffle 步骤二者在常数因子内匹配。shuffle 步骤是唯一的通信阶段,在一次 MapReduce 调用中所有信息从 map 工作节点传输至 reduce 工作节点。因此,与以往工作不同,我们将关注点转向内部通信步骤。我们所得的结果进一步可推广至 BSP* 模型。一方面,这展示了与 PEM 相比,用 MapReduce 表达的算法能够“隐藏”多少复杂度;另一方面,我们的结果界定了 MapReduce 方法在 I/O 效率方面最坏情况下的性能损失。
引用
@article{arxiv.1112.3765,
title = {The Efficiency of MapReduce in Parallel External Memory},
author = {Gero Greiner and Riko Jacob},
journal= {arXiv preprint arXiv:1112.3765},
year = {2011}
}