中文

特征移除是模型解释方法的一个统一原理

机器学习 2022-08-24 v2 机器学习

摘要

研究者提出了各种各样的模型解释方法,但大多数方法之间的关系以及何时某种方法优于另一种方法仍不清楚。我们审视了相关文献,发现许多方法基于一个共享的原理:通过移除进行解释——本质上,衡量从模型中移除特征集所产生的影响。这些方法在若干方面存在差异,因此我们开发了一个基于移除的解释框架,沿三个维度刻画每种方法:1)该方法如何移除特征,2)该方法解释何种模型行为,3)该方法如何总结每个特征的影响。我们的框架统一了26种现有方法,包括几种最广泛使用的方法(SHAP、LIME、Meaningful Perturbations、置换检验)。揭示这些方法之间的根本相似性,使用户能够推理使用哪些工具,并为持续的模型可解释性研究指明了有前景的方向。

关键词

引用

@article{arxiv.2011.03623,
  title  = {Feature Removal Is a Unifying Principle for Model Explanation Methods},
  author = {Ian Covert and Scott Lundberg and Su-In Lee},
  journal= {arXiv preprint arXiv:2011.03623},
  year   = {2022}
}

备注

Updated for consistency with arxiv:2011.14878