CX-ToM:融合心理理论的反事实解释以增强人类对图像识别模型的信任
人工智能
2021-12-06 v3 计算机视觉与模式识别
机器学习
摘要
我们提出 CX-ToM(全称 counterfactual explanations with theory-of-mind,融合心理理论的反事实解释),一种用于解释深度卷积神经网络(CNN)决策的新可解释 AI(XAI)框架。与当前 XAI 中作为单次响应生成解释的方法不同,我们将解释建模为机器与人类用户之间的迭代沟通过程,即对话。更具体地,我们的 CX-ToM 框架通过在机器与人类用户心智之间的差异进行调和,在对话中生成一系列解释。为此,我们使用心理理论(ToM),它帮助我们显式建模人的意图、由人推断的机器心智,以及由机器推断的人之心智。此外,多数 SOTA 的 XAI 框架提供基于注意力(或热力图)的解释。在我们的工作中,我们表明这些基于注意力的解释不足以提升人类对底层 CNN 模型的信任。在 CX-ToM 中,我们转而使用称为 fault-lines 的反事实解释,其定义如下:给定输入图像 I 及对其预测类别 c_pred 的 CNN 分类模型 M,fault-line 识别出需添加至或从 I 中删除的最小语义级特征(如斑马条纹、狗的尖耳),称为可解释概念,以将 I 经 M 的分类类别改变为另一指定类别 c_alt。我们认为,由于 CX-ToM 解释的迭代性、概念性与反事实性,我们的框架实用且更自然,便于专家与非专家用户理解复杂深度学习模型的内部机制。大量定量与定性实验验证了我们的假设,表明我们的 CX-ToM 显著优于 SOTA 可解释 AI 模型。
引用
@article{arxiv.2109.01401,
title = {CX-ToM: Counterfactual Explanations with Theory-of-Mind for Enhancing Human Trust in Image Recognition Models},
author = {Arjun R. Akula and Keze Wang and Changsong Liu and Sari Saba-Sadiya and Hongjing Lu and Sinisa Todorovic and Joyce Chai and Song-Chun Zhu},
journal= {arXiv preprint arXiv:2109.01401},
year = {2021}
}
备注
Accepted by iScience Cell Press Journal 2021. arXiv admin note: text overlap with arXiv:1909.06907