中文

Spark云计算环境下面向大数据的并行随机森林算法

分布式、并行与集群计算 2019-11-26 v1

摘要

随着大数据时代的到来,如何高效且准确地从数据集中获取有价值知识的问题日益受到学术界和工业界的关注。本文提出一种在Apache Spark平台上面向大数据的并行随机森林(PRF)算法。该PRF算法基于数据并行与任务并行优化相结合的混合方法进行优化。从数据并行优化角度看,采用垂直数据划分方法有效降低数据通信开销,并采用数据复用方法使训练数据集得以重用并减少数据量。从任务并行优化角度看,在随机森林(RF)训练过程中实施双重并行方法,并根据PRF的并行训练过程及弹性分布式数据集(RDD)对象的依赖关系创建任务有向无环图(DAG),随后为DAG中的任务调用不同的任务调度器。此外,为提高算法对大型、高维及含噪数据的准确率,我们在并行化之前于训练过程中执行降维方法,并于预测过程中执行加权投票方法。大量实验结果表明,PRF算法在分类准确率、性能及可扩展性方面优于Spark MLlib实现的相关算法及其他研究。

关键词

引用

@article{arxiv.1810.07748,
  title  = {A Parallel Random Forest Algorithm for Big Data in a Spark Cloud Computing Environment},
  author = {Jianguo Chen and Kenli Li and Zhuo Tang and Kashif Bilal and Shui Yu and Chuliang Weng and Keqin Li},
  journal= {arXiv preprint arXiv:1810.07748},
  year   = {2019}
}