针对可解释深度学习系统的单类目标特定攻击
计算机视觉与模式识别
2023-07-14 v1
摘要
在本文中,我们提出了一种称为 SingleADV 的新型单类目标特定对抗攻击。SingleADV 的目标是生成一种通用扰动,使目标模型将特定类别的物体与目标类别混淆,同时确保高度相关且准确的解释。该通用扰动通过随机且迭代地优化来最小化对抗损失,该损失被设计为同时考虑目标类别与非目标类别中的分类器与解释器代价。在此优化框架中,由一阶与二阶矩估计所主导,所需的损失曲面提升了对抗样本的高置信度与解释得分。通过避免对其他类别样本的非预期误分类,SingleADV 在白盒与黑盒场景下均可对可解释深度学习系统实施更有效的目标攻击。为评估 SingleADV 的有效性,我们使用四种不同模型架构(ResNet-50、VGG-16、DenseNet-169 和 Inception-V3)与三种解释模型(CAM、Grad 和 MASK)进行实验。通过广泛的实证评估,我们证明了 SingleADV 在各种条件与设置下均能有效地欺骗目标深度学习模型及其关联解释器。实验结果表明,SingleADV 性能有效,在生成欺骗性对抗样本时平均欺骗率达 0.74,对抗置信度水平为 0.78。此外,我们讨论了针对 SingleADV 的若干对策,包括基于迁移学习的方法与现有的预处理防御。
引用
@article{arxiv.2307.06484,
title = {Single-Class Target-Specific Attack against Interpretable Deep Learning Systems},
author = {Eldor Abdukhamidov and Mohammed Abuhamad and George K. Thiruvathukal and Hyoungshick Kim and Tamer Abuhmed},
journal= {arXiv preprint arXiv:2307.06484},
year = {2023}
}
备注
13 pages