中文

基于攻击不变特征防御对抗样本

计算机视觉与模式识别 2021-06-10 v1

摘要

深度神经网络(DNNs)易受对抗噪声攻击。利用对抗样本可提升其对抗鲁棒性。然而,鉴于不断演化的攻击,在已见对抗样本类型上训练的模型通常无法很好地泛化到未见过的对抗样本类型。为解决此问题,本文提出通过跨攻击学习保持语义分类信息的可泛化不变特征来去除对抗噪声。具体而言,我们引入对抗特征学习机制,将不变特征与对抗噪声解耦。在攻击不变特征的编码空间中提出了一种归一化项,以解决已见与未见攻击类型间的偏差问题。实证评估表明,与先前最先进的方法相比,我们的方法能提供更优的防护,尤其针对未见攻击类型和自适应攻击。

关键词

引用

@article{arxiv.2106.05036,
  title  = {Towards Defending against Adversarial Examples via Attack-Invariant Features},
  author = {Dawei Zhou and Tongliang Liu and Bo Han and Nannan Wang and Chunlei Peng and Xinbo Gao},
  journal= {arXiv preprint arXiv:2106.05036},
  year   = {2021}
}