中文

探索深度神经网络中可解释性与鲁棒性的相互作用:一种显著性引导方法

计算机视觉与模式识别 2024-05-13 v1 密码学与安全

摘要

对抗性攻击对在安全关键应用中部署深度学习模型构成了重大挑战。在确保可解释性的同时保持模型鲁棒性,对于培养对这些模型的信任和理解至关重要。本研究探讨了显著性引导训练(SGT)对模型鲁棒性的影响,该技术旨在提高显著性图的清晰度,以加深对模型决策过程的理解。实验在标准基准数据集上进行,使用了多种深度学习架构,并分别采用和不采用SGT进行训练。研究结果表明,SGT同时增强了模型的鲁棒性和可解释性。此外,我们提出了一种将SGT与标准对抗训练相结合的新方法,以在保持显著性图质量的同时实现更高的鲁棒性。我们的策略基于以下假设:保留对正确分类对抗样本至关重要的显著特征可增强模型鲁棒性,而掩盖非相关特征则可提高可解释性。我们的技术取得了显著提升,在MNIST和CIFAR-10数据集上,对于噪声幅度分别为0.20.20.020.02的PGD攻击,鲁棒性分别提高了35%和20%,同时生成了高质量的显著性图。

关键词

引用

@article{arxiv.2405.06278,
  title  = {Exploring the Interplay of Interpretability and Robustness in Deep Neural Networks: A Saliency-guided Approach},
  author = {Amira Guesmi and Nishant Suresh Aswani and Muhammad Shafique},
  journal= {arXiv preprint arXiv:2405.06278},
  year   = {2024}
}