任意分类器的可度量反事实局部解释
人工智能
2019-11-26 v2 机器学习
摘要
我们提出了一种解释任意分类器预测结果的新方法。在我们的方法中,局部解释应当既解释预测的结果,又解释如果“情况有所不同”该预测将如何变化。此外,我们认为令人满意的解释不能与保真度的概念和度量相脱离,正如神经网络知识提取早期所倡导的那样。我们引入了一种基于到目标决策边界距离的局部解释模型对底层分类器的保真度定义。我们介绍并评估了一个称为 CLEAR(通过回归的反事实局部解释,Counterfactual Local Explanations via Regression)的系统。CLEAR 生成 w-反事实解释,指出翻转预测分类所需的最小改变。随后 CLEAR 利用 w-反事实构建局部回归模型,以度量并提升其回归的保真度。相比之下,同样使用回归生成局部解释的流行方法 LIME 既不度量自身保真度也不生成反事实。本文的四个案例研究中,CLEAR 的回归被发现具有显著高于 LIME 的保真度,平均高出 45% 以上。
引用
@article{arxiv.1908.03020,
title = {Measurable Counterfactual Local Explanations for Any Classifier},
author = {Adam White and Artur d'Avila Garcez},
journal= {arXiv preprint arXiv:1908.03020},
year = {2019}
}