插值对随机森林回归是否有益
统计理论
2023-02-10 v3 统计理论
摘要
统计学常识认为,非常复杂的模型若对训练数据进行插值,则在预测未见样本时会表现不佳。然而,这一格言近来因良性过拟合机制的发现而受到挑战,此类机制尤其在参数模型的情形下被研究:尽管模型复杂度高,泛化能力仍可能得以保持。虽然众所周知完全生长的决策树会插值因而预测性能差,但随机森林(RF)的相同行为尚待分析。本文研究多种RF算法在插值与一致性之间的权衡。理论上,我们证明对于若干非自适应RF,插值机制与一致性无法同时实现。由于自适应似乎是将插值与一致性结合在一起的基石,我们研究插值中位数RF,并证明其在插值机制下是一致的。这是首个调和RF中插值与一致性的结果,凸显特征随机化引入的平均效应是关键机制,足以保证在插值机制及更广范围内的一致性。数值实验表明,当不涉及自助法步骤时,Breiman的RF在精确插值的同时是一致的。我们从理论上控制了插值区域的规模,其收敛到零的速度足够快,给出了精确插值与一致性同时发生的必要条件。
引用
@article{arxiv.2202.03688,
title = {Is interpolation benign for random forest regression?},
author = {Ludovic Arnould and Claire Boyer and Erwan Scornet},
journal= {arXiv preprint arXiv:2202.03688},
year = {2023}
}