相关的不相关:为图像分类器生成反事实解释
计算机视觉与模式识别
2024-05-10 v1 人工智能
机器学习
摘要
在本文中,我们展示了针对黑盒图像分类器的反事实解释的可行性。反事实思维领域中传统的解释机制是可解释人工智能 (XAI) 的一种广泛使用的范式,因为它们遵循人类所熟悉的自然推理方式。然而,该领域最常见的方法是基于传达关于对 AI 决策尤为重要的特征或特征信息。然而,要完全理解一个决策,不仅需要了解相关特征的知识,对无关信息的意识也极大地有助于用户建立对 AI 系统的心理模型。为此,最近在概念层面上提出了一种名为反事实解释的用于解释 AI 系统的新方法。它基于展示一种替代现实,其中 AI 输入的无关特征被改变。通过这样做,用户可以直接看到哪些输入数据特征可以任意改变而不影响 AI 的决策。在本文中,我们首次证明可以将这一想法应用于基于神经网络的黑盒模型。为此,我们提出了一种基于 GAN 的方法来为二值图像分类器生成这些反事实解释。此外,我们提出了一项用户研究,就反事实解释如何补充反事实解释提供了有趣的见解。
引用
@article{arxiv.2405.05295,
title = {Relevant Irrelevance: Generating Alterfactual Explanations for Image Classifiers},
author = {Silvan Mertes and Tobias Huber and Christina Karle and Katharina Weitz and Ruben Schlagowski and Cristina Conati and Elisabeth André},
journal= {arXiv preprint arXiv:2405.05295},
year = {2024}
}
备注
Accepted at IJCAI 2024. arXiv admin note: text overlap with arXiv:2207.09374