ranger: 高维数据随机森林的 C++ 与 R 快速实现
机器学习
2018-05-18 v2 统计计算
摘要
我们介绍了 C++ 应用程序与 R 包 ranger。该软件是高维数据随机森林的快速实现。支持分类、回归与生存树的集成。我们描述了实现过程,提供了示例,通过参考实现验证了该包,并与其他实现在运行时间与内存占用上进行了比较。新软件被证明在特征数、样本数、树的数量以及尝试分裂的特征数方面具有最佳的可扩展性。最后,我们表明 ranger 是分析全基因组关联研究规模数据最快且最节省内存的随机森林实现。
引用
@article{arxiv.1508.04409,
title = {ranger: A Fast Implementation of Random Forests for High Dimensional Data in C++ and R},
author = {Marvin N. Wright and Andreas Ziegler},
journal= {arXiv preprint arXiv:1508.04409},
year = {2018}
}