中文

随机森林的广度优先、深度优先混合训练

机器学习 2019-10-16 v1 机器学习

摘要

在本文中,我们分析、评估并改进了在现代 CPU 架构上训练随机森林(Random Forest, RF)模型的性能。本研究以精确的、最先进的二叉决策树构建算法为基础。首先,我们研究了使用不同树构建算法(即广度优先搜索(BFS)和深度优先搜索(DFS))之间的权衡。我们设计了一种新颖的、动态的、混合 BFS-DFS 算法,并证明其性能优于 BFS 和 DFS,并且在具有不同特征的工作负载下更具鲁棒性。其次,我们识别了使用该方法生成树时的 CPU 性能瓶颈,并提出了缓解这些瓶颈的优化方案。所提出的 RF 混合树构建算法在 Snap 机器学习框架中实现,在一系列数据集、RF 配置和多核 CPU 架构上,与最先进的 RF 求解器(sklearn、H2O 和 xgboost)相比,将 RF 的训练速度平均提升了 7.8 倍。

关键词

引用

@article{arxiv.1910.06853,
  title  = {Breadth-first, Depth-next Training of Random Forests},
  author = {Andreea Anghel and Nikolas Ioannou and Thomas Parnell and Nikolaos Papandreou and Celestine Mendler-Dünner and Haris Pozidis},
  journal= {arXiv preprint arXiv:1910.06853},
  year   = {2019}
}