中文

DANAA:面向可迁移攻击的双重对抗神经元归因方法

计算机视觉与模式识别 2023-10-24 v2

摘要

尽管深度神经网络在许多领域取得了优异结果,但它们易受对抗样本干扰而产生错误判断。特征级攻击是有效攻击类型之一,其针对隐藏层中学得的特征以提升跨不同模型的可迁移性。然而观察到,可迁移性受神经元重要性估计结果影响较大。本文提出一种称为“DANAA”的双重对抗神经元归因攻击方法,以获得更精确的特征重要性估计。在我们的方法中,基于对抗非线性路径将模型输出归因至中间层,旨在度量单个神经元权重并保留对可迁移性更重要的特征。我们在基准数据集上进行了广泛实验,证明了该方法的最优性能。我们的代码见:https://github.com/Davidjinzb/DANAA

关键词

引用

@article{arxiv.2310.10427,
  title  = {DANAA: Towards transferable attacks with double adversarial neuron attribution},
  author = {Zhibo Jin and Zhiyu Zhu and Xinyi Wang and Jiayu Zhang and Jun Shen and Huaming Chen},
  journal= {arXiv preprint arXiv:2310.10427},
  year   = {2023}
}

备注

Accepted by 19th International Conference on Advanced Data Mining and Applications. (ADMA 2023)