中文

面向大数据量的随机竞争风险森林

统计方法学 2022-07-26 v1 统计计算

摘要

随机森林是一种根据若干协变量预测竞争风险数据的合理非参数模型。然而,目前没有软件包能够充分处理大型数据集(n>100,000n > 100,000)。我们引入了一个新的 R 包 largeRCRF,使用 Ishwaran 等人(2014)提出的随机竞争风险森林理论。我们通过模拟研究验证了该包的有效性与准确性,并表明其结果与 randomForestSRC 足够相似,同时运行时间更短。我们还在一个此前无法处理的大型数据集上演示了该包,所用硬件需求对大多数研究者而言均可满足。

关键词

引用

@article{arxiv.2207.11590,
  title  = {Random Competing Risks Forests for Large Data},
  author = {Joel Therrien and Jiguo Cao},
  journal= {arXiv preprint arXiv:2207.11590},
  year   = {2022}
}