中文

愿景论文:探讨 Map-Reduce 计算的极限

数据库 2012-04-10 v1 分布式、并行与集群计算

摘要

近期的大量研究致力于解决在云中处理各种数据管理问题的挑战。Map-Reduce 计算中的主要算法挑战在于平衡众多因素,例如可用于 mapper/reducer 的机器数量、它们的内存需求以及通信开销(从 mapper 发送到 reducer 的数据总量)。过去的大多数工作针对特定问题提供了定制化解决方案,例如在 Map-Reduce 中执行模糊连接、聚类、图分析等。虽然有些问题可以设计出非常高效的 Map-Reduce 算法,但另一些问题则难以自然分布,且具有可证明的下界。显然,“Map-Reduce 可行性”的难易程度与问题能否被划分为分布在 mapper/reducer 上的独立部分密切相关。是什么使一个问题可分布?我们能否刻画问题的一般属性,以确定寻找高效 Map-Reduce 算法的难易程度?本文是一篇愿景论文,试图回答上述问题。

关键词

引用

@article{arxiv.1204.1754,
  title  = {Vision Paper: Towards an Understanding of the Limits of Map-Reduce Computation},
  author = {Foto N. Afrati and Anish Das Sarma and Semih Salihoglu and Jeffrey D. Ullman},
  journal= {arXiv preprint arXiv:1204.1754},
  year   = {2012}
}

备注

5 pages