中文

迈向特征归因与反事实解释的统一:殊途同归

机器学习 2021-06-01 v3 计算机与社会

摘要

特征归因和反事实解释是解释机器学习(ML)模型的常用方法。前者为每个输入特征分配一个重要性分数,而后者提供经过最小改动以改变模型预测的输入示例。为统一这些方法,我们基于实际因果框架给出一种解释,并从使用角度提出两个关键结果。首先,我们提出一种从一组反事实示例生成特征归因解释的方法。这些特征归因传达了某一特征对改变模型分类结果的重要性,特别是关于特征子集对该改变是否必要和/或充分,而基于归因的方法无法提供这一点。其次,我们展示了如何使用反事实示例从必要性和充分性角度评估基于归因的解释的优劣。由此,我们强调了这两种方法的互补性。我们在三个基准数据集——Adult-Income、LendingClub 和 German-Credit——上的评估证实了这种互补性。像 LIME 和 SHAP 这样的特征归因方法,与像 Wachter et al. 和 DiCE 这样的反事实解释方法,经常在特征重要性排序上不一致。此外,通过限制可用于生成反事实示例的修改特征,我们发现来自 LIME 或 SHAP 的 top-k 特征往往既非模型预测的必要性解释也非充分性解释。最后,我们给出了不同解释方法在一个真实世界医院分诊问题上的案例研究。

关键词

引用

@article{arxiv.2011.04917,
  title  = {Towards Unifying Feature Attribution and Counterfactual Explanations: Different Means to the Same End},
  author = {Ramaravind Kommiya Mothilal and Divyat Mahajan and Chenhao Tan and Amit Sharma},
  journal= {arXiv preprint arXiv:2011.04917},
  year   = {2021}
}

备注

15 pages, 10 figures