中文

可学习边界引导的对抗训练

计算机视觉与模式识别 2021-08-17 v2

摘要

以往的对抗训练以自然数据上的准确率为代价来提升模型鲁棒性。本文中,我们减少了自然准确率的退化。我们利用一个干净模型的模型 logits 来引导另一个鲁棒模型的学习,考虑到训练良好的干净模型的 logits 嵌入了自然数据最具判别性的特征,例如可泛化的分类器边界。我们的解决方案是约束以对抗样本为输入且由鲁棒模型产生的 logits,使其与对应自然数据喂入干净模型所产生的 logits 相似。这让鲁棒模型继承了干净模型的分类器边界。此外,我们观察到这种边界引导不仅能保持高自然准确率,还能有益于模型鲁棒性,这为对抗社区提供了新见解并推动其进展。最后,在 CIFAR-10、CIFAR-100 和 Tiny ImageNet 上的大量实验证明了我们方法的有效性。我们在 CIFAR-100 上无需额外真实或合成数据,借助 auto-attack 基准\footnote{\url{https://github.com/fra31/auto-attack}} 取得了新的 SOTA 鲁棒性。我们的代码见 \url{https://github.com/dvlab-research/LBGAT}。

关键词

引用

@article{arxiv.2011.11164,
  title  = {Learnable Boundary Guided Adversarial Training},
  author = {Jiequan Cui and Shu Liu and Liwei Wang and Jiaya Jia},
  journal= {arXiv preprint arXiv:2011.11164},
  year   = {2021}
}

备注

ICCV2021