中文

关于影响 Hadoop 集群上基于 MapReduce 的 Apriori 算法性能因素的观察

数据库 2017-01-24 v1 分布式、并行与集群计算 数据结构与算法

摘要

设计快速且可扩展的频繁项集挖掘算法一直是数据挖掘中最突出且最有前景的问题之一。Apriori 是最广泛使用和流行的频繁项集挖掘算法之一。在 MapReduce 框架上设计高效算法以处理和分析大数据集是当前的研究热点。本文重点关注基于 MapReduce 的 Apriori 算法在同构及异构 Hadoop 集群上的性能。我们调查了诸多显著影响运行在同构和异构 Hadoop 集群上的基于 MapReduce 的 Apriori 执行时间的因素。这些因素特定于算法改进和非算法改进。针对算法改进考虑的因素包括过滤事务和数据结构。实验结果表明,适当的数据结构和过滤事务技术能大幅减少执行时间。非算法因素包括推测执行、性能较差的节点、数据局部性与数据块分布,以及通过输入分片大小控制的并行度。我们针对这些因素应用了策略,并在我们的特定应用中微调了相关参数。实验结果表明,如果妥善处理集群特定参数,执行时间将显著减少。此外,我们还讨论了 Apriori 的 MapReduce 实现中可能显著影响性能的问题。

关键词

引用

@article{arxiv.1701.05982,
  title  = {Observations on Factors Affecting Performance of MapReduce based Apriori on Hadoop Cluster},
  author = {Sudhakar Singh and Rakhi Garg and P. K. Mishra},
  journal= {arXiv preprint arXiv:1701.05982},
  year   = {2017}
}

备注

8 pages, 8 figures, International Conference on Computing, Communication and Automation (ICCCA2016)