中文

基于Apriori与FP-Growth算法的频繁项集挖掘平台评测

数据库 2019-03-01 v1 分布式、并行与集群计算

摘要

随着来自任何地点、任何时间、任何设备的复杂异构数据海量涌来,大数据时代已毋庸置疑。大数据作为下一代智能系统的颠覆性技术的出现,带来了诸多如何在短时间内、有限预算下以及高数据生成速率下提取和利用从数据中获得的知识的问题。企业认识到大数据可用于做出更准确的预测,并可在适当的关联规则挖掘算法的帮助下改进业务。为了帮助这些组织根据其数据集判断哪种软件和算法更适合他们,我们在不同规模的数据集上,比较了最著名的三个基于MapReduce的软件Hadoop、Spark、Flink在两种广泛使用算法Apriori和Fp-Growth上的表现。

关键词

引用

@article{arxiv.1902.10999,
  title  = {Evaluation of Frequent Itemset Mining Platforms using Apriori and FP-Growth Algorithm},
  author = {Ravi Ranjan and Aditi Sharma},
  journal= {arXiv preprint arXiv:1902.10999},
  year   = {2019}
}