中文

以反对抗层抵御对抗攻击者

机器学习 2021-12-17 v2 计算机视觉与模式识别

摘要

深度神经网络易受称为对抗攻击的小输入扰动影响。受此类对抗样本通过迭代最小化网络对真实类标签的置信度而构造这一事实启发,我们提出反对抗层(anti-adversary layer),旨在抵消该效应。具体而言,我们的层生成与对抗扰动方向相反的输入扰动,并向分类器输入扰动后的版本。我们的方法无需训练且具理论支撑。我们通过将本层与常规训练及鲁棒训练模型结合来验证有效性,并在 CIFAR10、CIFAR100 和 ImageNet 上从黑盒到自适应攻击开展大规模实验。我们的层显著增强模型鲁棒性,且在干净准确率上毫无代价。

关键词

引用

@article{arxiv.2103.14347,
  title  = {Combating Adversaries with Anti-Adversaries},
  author = {Motasem Alfarra and Juan C. Pérez and Ali Thabet and Adel Bibi and Philip H. S. Torr and Bernard Ghanem},
  journal= {arXiv preprint arXiv:2103.14347},
  year   = {2021}
}

备注

Accepted to AAAI Conference on Artificial Intelligence (AAAI'22)