i2MapReduce:用于挖掘演化大数据的增量 MapReduce
分布式、并行与集群计算
2015-01-21 v1
摘要
随着新数据和更新不断到达,数据挖掘应用的结果会随时间变得过时和陈旧。增量处理是一种刷新挖掘结果的有前景的方法,它利用先前保存的状态以避免从头重新计算的开销。在本文中,我们提出了 i2MapReduce,这是针对最广泛使用的大数据挖掘框架 MapReduce 的一种新型增量处理扩展。与 Incoop 上的最先进工作相比,i2MapReduce (i) 执行键值对级别的增量处理,而非任务级别的重新计算;(ii) 不仅支持单步计算,还支持数据挖掘应用中广泛使用的更复杂的迭代计算;(iii) 结合了一系列新技术以减少访问保存的细粒度计算状态的 I/O 开销。我们使用一种单步算法和三种具有不同计算特性的迭代算法对 i2MapReduce 进行了评估。在 Amazon EC2 上的实验结果表明,与执行重新计算的普通 MapReduce 和迭代 MapReduce 相比,i2MapReduce 的性能显著提升。
引用
@article{arxiv.1501.04854,
title = {i2MapReduce: Incremental MapReduce for Mining Evolving Big Data},
author = {Yanfeng Zhang and Shimin Chen and Qiang Wang and Ge Yu},
journal= {arXiv preprint arXiv:1501.04854},
year = {2015}
}