DANAA:面向可迁移攻击的双重对抗神经元归因方法
计算机视觉与模式识别
2023-10-24 v2
摘要
尽管深度神经网络在许多领域取得了优异结果,但它们易受对抗样本干扰而产生错误判断。特征级攻击是有效攻击类型之一,其针对隐藏层中学得的特征以提升跨不同模型的可迁移性。然而观察到,可迁移性受神经元重要性估计结果影响较大。本文提出一种称为“DANAA”的双重对抗神经元归因攻击方法,以获得更精确的特征重要性估计。在我们的方法中,基于对抗非线性路径将模型输出归因至中间层,旨在度量单个神经元权重并保留对可迁移性更重要的特征。我们在基准数据集上进行了广泛实验,证明了该方法的最优性能。我们的代码见:https://github.com/Davidjinzb/DANAA
引用
@article{arxiv.2310.10427,
title = {DANAA: Towards transferable attacks with double adversarial neuron attribution},
author = {Zhibo Jin and Zhiyu Zhu and Xinyi Wang and Jiayu Zhang and Jun Shen and Huaming Chen},
journal= {arXiv preprint arXiv:2310.10427},
year = {2023}
}
备注
Accepted by 19th International Conference on Advanced Data Mining and Applications. (ADMA 2023)