中文

无限制置换迫使外推:变量重要性至少需要再多一个模型,否则不存在免费的变量重要性

统计方法学 2021-10-11 v2 机器学习 机器学习

摘要

本文回顾并反对使用置换并预测(PaP)方法来解释黑盒函数。诸如为随机森林提出的变量重要性度量、偏依赖图和个体条件期望图等方法仍然流行,因为它们既与模型无关,又仅依赖于预训练模型的输出,使其在软件中计算高效且广泛可用。然而,大量研究发现这些工具会产生极具误导性的诊断结果,尤其是在特征间存在强依赖时。我们此工作的目的是:(i)回顾这一不断增长的文献;(ii)进一步展示这些缺陷,并详细解释其产生原因;(iii)倡导涉及额外建模的替代度量。特别地,我们描述了在留出数据中打破特征间依赖,会通过迫使原始模型外推到数据极少或无数据的特征空间稀疏区域,从而不当地强调这些区域。我们在各种模型设置中探究了这些效应,并为文献中先前的主张提供了支持,即 PaP 度量会在变量重要性度量和偏依赖图中极大地过度强调相关特征。作为替代,我们讨论并推荐更直接的途径,即测量在屏蔽所研究特征的影响后模型性能的变化。

关键词

引用

@article{arxiv.1905.03151,
  title  = {Unrestricted Permutation forces Extrapolation: Variable Importance Requires at least One More Model, or There Is No Free Variable Importance},
  author = {Giles Hooker and Lucas Mentch and Siyu Zhou},
  journal= {arXiv preprint arXiv:1905.03151},
  year   = {2021}
}