中文

通过基于神经元归因的攻击提升对抗可迁移性

机器学习 2022-04-04 v1 密码学与安全

摘要

深度神经网络(DNNs)已知易受对抗样本攻击。因此,在安全敏感应用中,事先设计有效的攻击算法以识别DNNs的缺陷势在必行。为高效应对目标模型细节未知的黑盒设定,特征级基于迁移的攻击提出污染本地模型的中间特征输出,然后直接利用生成的对抗样本攻击目标模型。由于特征的可迁移性,特征级攻击在合成更具可迁移性的对抗样本方面已显示出前景。然而,现有特征级攻击通常采用不准确的神经元重要性估计,这损害了它们的可迁移性。为克服此类缺陷,本文提出基于神经元归因的攻击(NAA),其以更准确的神经元重要性估计执行特征级攻击。具体而言,我们首先将模型输出完全归因到中间层的每个神经元。然后推导出神经元归因的近似方案以极大降低计算开销。最后,我们基于归因结果对神经元加权并发起特征级攻击。大量实验证实了我们的方法相对于最先进基准的优越性。

关键词

引用

@article{arxiv.2204.00008,
  title  = {Improving Adversarial Transferability via Neuron Attribution-Based Attacks},
  author = {Jianping Zhang and Weibin Wu and Jen-tse Huang and Yizhan Huang and Wenxuan Wang and Yuxin Su and Michael R. Lyu},
  journal= {arXiv preprint arXiv:2204.00008},
  year   = {2022}
}

备注

CVPR 2022