探索深度神经网络中可解释性与鲁棒性的相互作用:一种显著性引导方法
计算机视觉与模式识别
2024-05-13 v1 密码学与安全
摘要
对抗性攻击对在安全关键应用中部署深度学习模型构成了重大挑战。在确保可解释性的同时保持模型鲁棒性,对于培养对这些模型的信任和理解至关重要。本研究探讨了显著性引导训练(SGT)对模型鲁棒性的影响,该技术旨在提高显著性图的清晰度,以加深对模型决策过程的理解。实验在标准基准数据集上进行,使用了多种深度学习架构,并分别采用和不采用SGT进行训练。研究结果表明,SGT同时增强了模型的鲁棒性和可解释性。此外,我们提出了一种将SGT与标准对抗训练相结合的新方法,以在保持显著性图质量的同时实现更高的鲁棒性。我们的策略基于以下假设:保留对正确分类对抗样本至关重要的显著特征可增强模型鲁棒性,而掩盖非相关特征则可提高可解释性。我们的技术取得了显著提升,在MNIST和CIFAR-10数据集上,对于噪声幅度分别为和的PGD攻击,鲁棒性分别提高了35%和20%,同时生成了高质量的显著性图。
引用
@article{arxiv.2405.06278,
title = {Exploring the Interplay of Interpretability and Robustness in Deep Neural Networks: A Saliency-guided Approach},
author = {Amira Guesmi and Nishant Suresh Aswani and Muhammad Shafique},
journal= {arXiv preprint arXiv:2405.06278},
year = {2024}
}