中文

事后可解释性的危险:无根据的反事实解释

机器学习 2021-04-14 v1 人工智能 机器学习

摘要

事后可解释性方法已被证明是为训练好的黑盒模型所做的预测生成解释的强大工具。然而,它们带来了一种风险,即产生的解释是模型学到的某些伪影的结果,而非来自数据的实际知识。本文关注反事实解释的情况,并探问所生成的实例是否可以被证明是合理的,即是否与某些真实数据连续相连。我们通过考察待解释预测实例的局部邻域来评估生成无根据反事实示例的风险,并表明对于多个数据集该风险相当高。此外,我们表明大多数最先进的方法无法区分有根据和无根据的反事实示例,从而导致用处较小的解释。

关键词

引用

@article{arxiv.1907.09294,
  title  = {The Dangers of Post-hoc Interpretability: Unjustified Counterfactual Explanations},
  author = {Thibault Laugel and Marie-Jeanne Lesot and Christophe Marsala and Xavier Renard and Marcin Detyniecki},
  journal= {arXiv preprint arXiv:1907.09294},
  year   = {2021}
}