SCAAT:通过显著性约束自适应对抗训练改进神经网络可解释性
计算机视觉与模式识别
2023-11-13 v2
摘要
深度神经网络(DNNs)被期望为用户提供解释以理解其黑盒预测。显著性图是一种常见的解释形式,展示特征归因的热图,但其在区分重要特征时受到噪声干扰。本文提出一种模型无关的学习方法,称为显著性约束自适应对抗训练(SCAAT),以提升此类 DNN 可解释性的质量。通过在显著性图指导下构造对抗样本,SCAAT 有效消除大部分噪声,使显著性图更稀疏、更忠实,且无需修改模型架构。我们将 SCAAT 应用于多个 DNN,并在多种自然与病理图像数据集上评估所生成显著性图的质量。在不同领域与指标上的评估表明,SCAAT 通过提供更忠实的显著性图显著改进了 DNN 的可解释性,且不牺牲其预测能力。
引用
@article{arxiv.2311.05143,
title = {SCAAT: Improving Neural Network Interpretability via Saliency Constrained Adaptive Adversarial Training},
author = {Rui Xu and Wenkang Qin and Peixiang Huang and Hao Wang and Lin Luo},
journal= {arXiv preprint arXiv:2311.05143},
year = {2023}
}