中文

LAS-AT:采用可学习攻击策略的对抗训练

计算机视觉与模式识别 2022-03-15 v1

摘要

对抗训练(AT)总被表述为极小极大问题,其性能取决于涉及对抗样本(AEs)生成的内部优化。多数先前方法采用投影梯度下降(PGD)并手动指定攻击参数以生成对抗样本。攻击参数的组合可称为攻击策略。若干工作已揭示,在整个训练阶段使用固定攻击策略生成对抗样本会限制模型鲁棒性,并提出在不同训练阶段利用不同攻击策略以提升鲁棒性。但这些多阶段手工设计的攻击策略需要大量领域专业知识,且鲁棒性提升有限。本文中,我们通过引入“可学习攻击策略”概念提出一种新颖的对抗训练框架,称为 LAS-AT,其学习自动产生攻击策略以提升模型鲁棒性。我们的框架由使用对抗样本训练以提升鲁棒性的目标网络,以及生成攻击策略以控制对抗样本生成的策略网络组成。在三个基准数据库上的实验评估证明了所提方法的优越性。代码发布于 https://github.com/jiaxiaojunQAQ/LAS-AT。

关键词

引用

@article{arxiv.2203.06616,
  title  = {LAS-AT: Adversarial Training with Learnable Attack Strategy},
  author = {Xiaojun Jia and Yong Zhang and Baoyuan Wu and Ke Ma and Jue Wang and Xiaochun Cao},
  journal= {arXiv preprint arXiv:2203.06616},
  year   = {2022}
}