中文

利用 MapReduce 进行关系数据上查询驱动的高频共现词提取

数据库 2013-01-14 v1

摘要

本文研究了如何利用流行的 MapReduce 框架并行高效地计算关键词查询结果中的\textit{高频共现词} (FCT)。以关键词查询qq和整数kk作为输入,FCT 查询报告kk个不在qq中但在多个连接关系上的关键词查询qq结果中出现频率最高的项。FCT 搜索返回的项可用于传统关键词搜索的查询扩展和查询细化。与单一平台中的 FCT 搜索方法不同,我们提出的方法能够利用 MapReduce 范式高效回答 FCT 查询,而无需预先计算在并行平台上运行的原始关键词查询的结果。在这项工作中,我们可以通过两个 MapReduce 作业输出最终的 FCT 搜索结果:第一个作业用于提取数据的统计信息;第二个作业基于第一个作业的输出计算每个项的总频率。在这两个 MapReduce 作业中,我们尽可能保证映射器 (mappers) 的负载均衡和归约器 (reducers) 的计算平衡。分析和实验评估表明,我们提出的方法在使用不同规模的 TPC-H 基准数据集时具有高效性和可扩展性。

关键词

引用

@article{arxiv.1301.2378,
  title  = {Query-driven Frequent Co-occurring Term Extraction over Relational Data using MapReduce},
  author = {Jianxin Li and Chengfei Liu and Liang Yao and Jeffrey Xu Yu and Rui Zhou},
  journal= {arXiv preprint arXiv:1301.2378},
  year   = {2013}
}