中文

利用 MapReduce 高效处理多路 Theta-连接

数据库 2012-08-02 v1

摘要

多路 Theta-连接查询在描述复杂关系方面功能强大,因此在实际实践中被广泛采用。然而,传统分布式和并行数据库中针对多路 Theta-连接查询的现有解决方案难以轻易扩展以适应无共享分布式计算范式,而该范式已被证明能够支持海量数据上的 OLAP 应用。在本工作中,我们从成本效益的角度研究了利用 MapReduce 高效处理多路 Theta-连接查询的问题。虽然已有一些工作利用基于 (key,value) 对的编程模型来支持连接操作,但多路 Theta-连接查询的高效处理尚未得到充分探索。主要的挑战在于,给定若干处理单元(可运行 Map 或 Reduce 任务),如何将多路 Theta-连接查询映射到若干 MapReduce 作业,并使其按良好调度的顺序执行,从而最小化总处理时间跨度。我们的解决方案主要包括两部分:1) 针对单个 MapReduce 作业以及按特定顺序执行的多个 MapReduce 作业的成本度量;2) 仅用一个 MapReduce 作业高效执行链式类型的 Theta-连接。与 [23] 中提出的查询评估策略以及广泛采用的 Pig Latin 和 Hive SQL 解决方案相比,我们的方法在连接处理效率上取得了显著提升。

关键词

引用

@article{arxiv.1208.0081,
  title  = {Efficient Multi-way Theta-Join Processing Using MapReduce},
  author = {Xiaofei Zhang and Lei Chen and Min Wang},
  journal= {arXiv preprint arXiv:1208.0081},
  year   = {2012}
}

备注

VLDB2012