随机森林中不存在双下降现象
机器学习
2021-11-09 v1 机器学习
摘要
随机森林(RF)是机器学习中的前沿方法之一,以近乎零参数调优提供卓越性能。值得注意的是,尽管其基本构建模块已知会过拟合,RF 似乎不受过拟合影响。最近一项广受关注的研究主张 RF 表现出所谓的双下降曲线:首先,模型以 U 形曲线过拟合数据,然后一旦达到某种模型复杂度,其性能突然再次提升。本文中,我们质疑将模型容量作为解释 RF 成功之正确工具的观点,并主张训练模型的算法比先前认为的更为关键。我们展示 RF 并不呈现双下降曲线,而是具有单一下降。因此,它不以经典意义过拟合。我们进一步提出一种 RF 变体,其同样不过拟合,尽管其决策边界逼近过拟合决策树(DT)的边界。类似地,我们展示逼近 RF 决策边界的 DT 仍会过拟合。最后,我们研究集成多样性作为估计其性能的工具。为此,我们引入负相关森林(NCForest),可精确控制集成中的多样性。我们展示,多样性和偏差确实对 RF 性能有关键影响。多样性过低会使 RF 性能退化为单棵树,而多样性过高意味着多数树不再产生正确输出。然而,在这两极端间我们发现大范围不同权衡均具大致相等性能。因此,只要算法达到该良好权衡区间,偏差与多样性间的具体权衡并不重要。
引用
@article{arxiv.2111.04409,
title = {There is no Double-Descent in Random Forests},
author = {Sebastian Buschjäger and Katharina Morik},
journal= {arXiv preprint arXiv:2111.04409},
year = {2021}
}
备注
11 pages, 3 figures, 3 algorithms