中文

以攻击对抗攻击作为一种防御

机器学习 2021-06-10 v1 密码学与安全

摘要

众所周知,对抗攻击可通过难以察觉的扰动欺骗深度神经网络。尽管对抗训练显著提升了模型鲁棒性,防御的失败案例仍广泛存在。本工作中,我们发现对抗攻击同样易受小扰动影响。即在对抗训练模型上,用小的随机噪声扰动对抗样本可能使其误导性预测失效。在仔细考察各类最先进攻击后,我们发现所有这些攻击在不同程度上均有此缺陷。受该发现启发,我们提出通过构造更有效的防御性扰动来反击攻击。我们的防御性扰动利用了对抗训练赋予真实类别更小局部Lipschitz常数的优势。通过同时攻击所有类别,具有较大Lipschitz常数的误导性预测可被翻转为正确预测。我们在线性模型上通过经验实验与理论分析验证了防御性扰动。在CIFAR10上,针对AutoAttack的四种攻击,它将最先进模型从66.16%提升至72.66%,其中针对Square攻击从71.76%提升至83.30%。在ImageNet上,FastAT在100步PGD攻击下的top-1鲁棒准确率从33.18%提升至38.54%。

关键词

引用

@article{arxiv.2106.04938,
  title  = {Attacking Adversarial Attacks as A Defense},
  author = {Boxi Wu and Heng Pan and Li Shen and Jindong Gu and Shuai Zhao and Zhifeng Li and Deng Cai and Xiaofei He and Wei Liu},
  journal= {arXiv preprint arXiv:2106.04938},
  year   = {2021}
}