基于 MapReduce 框架的 Apriori 算法综述
数据库
2017-02-22 v1 分布式、并行与集群计算
摘要
挖掘频繁项集的 Apriori 算法是最流行且被广泛使用的数据挖掘算法之一。如今,为了提升 Apriori 算法的性能,人们已在并行与分布式平台上提出了许多算法。这些算法在负载均衡技术、内存系统、数据分解技术以及用于实现它们的数据布局方面存在差异。大多数分布式框架的问题在于管理分布式系统的开销以及缺乏高级并行编程语言。此外,在网格计算中,节点故障的可能性始终存在,这会导致任务的多次重新执行。Google 提出的 MapReduce 框架可以克服这些问题。MapReduce 是一种高效、可扩展且简化的编程模型,用于在大型商用计算机集群上进行大规模分布式数据处理,同时也被应用于云计算。本文概述了在 MapReduce 框架上实现的并行 Apriori 算法。根据用于实现这些算法的 Map 和 Reduce 函数对它们进行了分类,例如单阶段与 k 阶段、Mapper 的 I/O、Combiner 和 Reducer、在 Mapper 内部使用 Combiner 的功能等。本综述基于各种实现的不同特征,讨论并分析了 Apriori 在 MapReduce 框架上的多种实现。此外,还涵盖了 MapReduce 框架的优势与局限性。
引用
@article{arxiv.1702.06284,
title = {Review of Apriori Based Algorithms on MapReduce Framework},
author = {Sudhakar Singh and Rakhi Garg and P. K. Mishra},
journal= {arXiv preprint arXiv:1702.06284},
year = {2017}
}
备注
12 pages, 3 figures, ICC-2014