理解随机森林在概率估计中的过拟合:一项可视化与模拟研究
统计方法学
2024-10-01 v2 计算机与社会
机器学习
摘要
随机森林已广泛应用于临床风险预测建模。在一个预测卵巢恶性肿瘤的案例研究中,我们观察到训练 c-statistics 接近 1。虽然这表明存在过拟合,但在测试数据上的表现仍具有竞争力。我们旨在通过 (1) 在三个真实世界案例研究中可视化数据空间,以及 (2) 一项模拟研究来理解随机森林的行为。对于案例研究,使用热图在二维子空间中可视化风险估计。模拟研究包括 48 个逻辑数据生成机制 (DGM),变化因素包括预测变量分布、预测变量数量、预测变量之间的相关性、真实 c-statistic 以及真实预测变量的强度。对于每个 DGM,模拟了 1000 个大小为 200 或 4000 的训练数据集,并使用 ranger 包训练最小节点大小为 2 或 20 的 RF 模型,总共产生 192 种场景。可视化结果表明,模型学习了训练集中事件周围的概率尖峰。事件簇形成了更大的峰值,孤立事件形成局部峰值。在模拟研究中,除非有 4 个或 16 个二元预测变量且最小节点大小为 20,否则中位训练 c-statistics 介于 0.97 和 1 之间。随着每个变量的事件数增加、最小节点大小增加以及二元预测变量的存在,中位测试 c-statistics 更高。中位训练斜率始终大于 1,且在各种场景中与中位测试斜率不相关(相关性为 -0.11)。随着真实 c-statistic 更高、最小节点大小更大以及样本量更大,中位测试斜率更高。随机森林学习局部概率峰值,这通常产生近乎完美的训练 c-statistics,而不会强烈影响测试数据上的 c-statistics。当目标是概率估计时,模拟结果反对在随机森林模型中使用完全生长树的常见建议。
引用
@article{arxiv.2402.18612,
title = {Understanding overfitting in random forest for probability estimation: a visualization and simulation study},
author = {Lasai Barreñada and Paula Dhiman and Dirk Timmerman and Anne-Laure Boulesteix and Ben Van Calster},
journal= {arXiv preprint arXiv:2402.18612},
year = {2024}
}
备注
20 pages, 8 figures