基于证据反事实的可解释图像分类
机器学习
2020-04-17 v1 人工智能
计算机视觉与模式识别
摘要
最先进的图像分类建模技术的复杂性阻碍了对模型预测以可解释方式进行解释的能力。现有解释方法通常依据像素或像素组给出重要性排序。然而,所得解释缺乏最优大小、未考虑特征依赖性且仅与单一类别相关。反事实解释方法因具有高度的人类可解释性,被视为解释复杂模型决策的有力途径。本文引入 SEDC 作为一种模型无关、实例级的图像分类解释方法,以获得视觉反事实解释。对给定图像,SEDC 搜索一小段片段,若将其移除则会改变分类结果。由于图像分类任务通常为多类问题,我们提出 SEDC-T 作为一种替代方法,允许指定目标反事实类别。我们将 SEDC(-T) 与 LRP、LIME 和 SHAP 等流行的特征重要性方法进行比较,并说明上述重要性排序问题如何被解决。此外,具体示例与实验阐明了我们方法在(1)获取信任与洞察以及(2)通过解释误分类为模型改进提供输入的潜力。
引用
@article{arxiv.2004.07511,
title = {Explainable Image Classification with Evidence Counterfactual},
author = {Tom Vermeire and David Martens},
journal= {arXiv preprint arXiv:2004.07511},
year = {2020}
}
备注
23 pages, 13 figures