中文

MapReduce 上高级分析的早期准确结果

数据库 2012-07-03 v1

摘要

基于采样的近似结果往往是超大规模数据集上的高级分析应用满足其时间和资源约束的唯一途径。不幸的是,尽管面向 MapReduce 的系统旨在处理“大数据”,但目前尚不支持用于计算准确早期结果的方法和工具。因此,我们提出并实现了一种 Hadoop 的非参数扩展,允许为任意工作流增量计算早期结果,并提供对迄今所达到准确度的可靠在线估计。这些估计基于一种称为 bootstrap(自助法)的技术,该技术在统计学中得到了广泛应用,可适用于任意函数和数据分布。本文描述了我们的 Hadoop 早期准确结果库(EARL),其设计旨在最小化对 MapReduce 框架所需的更改。我们展示了 EARL 在 Hadoop 上的各项测试,以刻画 EARL 能够相比当前版本 Hadoop 提供重大加速的常见场景。

关键词

引用

@article{arxiv.1207.0142,
  title  = {Early Accurate Results for Advanced Analytics on MapReduce},
  author = {Nikolay Laptev and Kai Zeng and Carlo Zaniolo},
  journal= {arXiv preprint arXiv:1207.0142},
  year   = {2012}
}

备注

VLDB2012