面向 DCNN 图像分类器的反事实与对比可解释性与透明性
计算机视觉与模式识别
2025-01-14 v1 人工智能
摘要
深度卷积神经网络(DCNN)的可解释性是一个重要的研究主题,旨在揭示 DCNN 模型决策背后的原因,并提高其在高风险环境中的理解和可靠性。就此而言,我们提出了一种新方法,用于生成 DCNN 模型的可解释反事实和对比解释。该方法是模型侵入式的,通过探测 DCNN 内部工作方式来生成解释,而不是改变输入图像。给定一个输入图像,我们通过识别 DCNN 中最重要的过滤器来提供对比解释,这些过滤器代表了分离模型对输入图像是分类到原始推断类别还是其他指定 alter 类别之间决定的特征和概念。另一方面,我们通过指定这些过滤器以获得对比输出所必需的最小更改来提供反事实解释。利用这些识别的过滤器和概念,我们的方法可以提供模型决策背后的对比和反事实原因,并使模型更加透明。该方法的有趣应用之一是误分类分析,其中我们比较特定输入图像识别的概念与类别特定概念,以建立模型决策有效性。该方法与最新方法相比较,并在 Caltech-UCSD Birds(CUB)2011 数据集上进行评估,以显示所提供解释的有用性。
引用
@article{arxiv.2501.06831,
title = {Towards Counterfactual and Contrastive Explainability and Transparency of DCNN Image Classifiers},
author = {Syed Ali Tariq and Tehseen Zia and Mubeen Ghafoor},
journal= {arXiv preprint arXiv:2501.06831},
year = {2025}
}