随机森林的 MDA:不一致性及其基于 Sobol-MDA 的实用解决方案
机器学习
2022-03-02 v3 机器学习
摘要
变量重要性度量是分析随机森林黑箱机制的主要工具。尽管平均精度下降(MDA)被广泛认为是随机森林最有效的变量重要性度量,但其统计性质却鲜为人知。事实上,MDA 的定义在主流随机森林软件中各不相同。本文旨在严格分析主要 MDA 实现的行为。为此,我们对各种已实现的 MDA 算法进行数学形式化,并确立其在样本量增大时的极限。该渐近分析表明,这些 MDA 版本作为重要性度量存在差异,因为它们收敛于不同的量。更重要的是,我们将这些极限分解为三个分量:前两项与 Sobol 指数有关,Sobol 指数是协变量对响应方差贡献的明确定义的度量,在敏感性分析领域被广泛使用,而第三项则不同,其值随协变量内部依赖性的增强而增大。因此,我们从理论上证明,在依赖情形下 MDA 并未针对正确的量来检测有影响的协变量,这一事实此前已在实验中被注意到。为解决此问题,我们为随机森林定义了一种新的重要性度量——Sobol-MDA,它修正了原始 MDA 的缺陷,并一致地估计在移除给定协变量后重新训练森林的精度下降,且计算代价高效。在模拟和真实数据的变量选择上,Sobol-MDA 在经验上优于其竞争方法。R 和 C++ 的开源实现可在线获取。
引用
@article{arxiv.2102.13347,
title = {MDA for random forests: inconsistency, and a practical solution via the Sobol-MDA},
author = {Clément Bénard and Sébastien da Veiga and Erwan Scornet},
journal= {arXiv preprint arXiv:2102.13347},
year = {2022}
}