中文

RDD-Eclat:Spark RDD 框架上 Eclat 算法的并行化方法

分布式、并行与集群计算 2019-12-16 v1 数据库 数据结构与算法 机器学习

摘要

最初,许多频繁项集挖掘(FIM)算法被设计在分布式大数据处理框架 Hadoop MapReduce 上。但由于繁重的磁盘 I/O,MapReduce 对此类高度迭代算法效率低下。因此,Spark 这一更高效的分布式数据处理框架被开发出来,其具备内存计算和弹性分布式数据集(RDD)特性以支持迭代算法。在 Spark RDD 框架上,已设计了基于 Apriori 和 FP-Growth 的 FIM 算法,但基于 Eclat 的算法尚未被探索。本文提出 RDD-Eclat,一种 Spark RDD 框架上的并行 Eclat 算法及其五种变体。所提算法在多个基准数据集上评估,结果表明 RDD-Eclat 性能优于基于 Spark 的 Apriori 数倍。此外,实验结果展示了所提算法在核心数和数据集规模增加时的可扩展性。

关键词

引用

@article{arxiv.1912.06415,
  title  = {RDD-Eclat: Approaches to Parallelize Eclat Algorithm on Spark RDD Framework},
  author = {Pankaj Singh and Sudhakar Singh and P. K. Mishra and Rakhi Garg},
  journal= {arXiv preprint arXiv:1912.06415},
  year   = {2019}
}

备注

16 pages, 6 figures, ICCNCT 2019