Hadoop集群上基于MapReduce的Apriori算法性能优化
分布式、并行与集群计算
2018-07-18 v1 数据库
摘要
已有许多技术被提出用于在MapReduce框架上实现Apriori算法,但只有少数关注性能提升。FPC(固定趟数合并计数)和DPC(动态趟数合并计数)算法将Apriori的多趟计算合并到单个MapReduce阶段以减少执行时间。本文中,我们在FPC和DPC基础上提出改进的基于MapReduce的Apriori算法VFPC(基于可变大小的固定趟数合并计数)和ETDPC(基于已用时间的动态趟数合并计数)。进一步,我们通过在某些趟中跳过剪枝步骤来优化这些算法的多趟阶段,并提出Optimized-VFPC和Optimized-ETDPC算法。定量分析表明,因跳过剪枝而产生的额外未剪枝候选者的计数代价小于由此带来的计算代价减少。实验结果显示,VFPC和ETDPC比FPC和DPC更鲁棒和灵活,而其优化版本在执行时间方面更高效。
引用
@article{arxiv.1807.06070,
title = {Performance Optimization of MapReduce-based Apriori Algorithm on Hadoop Cluster},
author = {Sudhakar Singh and Rakhi Garg and P K Mishra},
journal= {arXiv preprint arXiv:1807.06070},
year = {2018}
}
备注
24 pages, 5 figures, 12 tables, 5 algorithms