中文

训练鲁棒视觉Transformer的轻量方案

计算机视觉与模式识别 2023-02-03 v2 机器学习

摘要

在本文中,我们探讨 Vision Transformers (ViTs) 能否作为底层架构,以提升机器学习模型对抗规避攻击的鲁棒性。尽管先前工作聚焦于改进卷积神经网络,我们表明 ViTs 同样非常适用于对抗训练以取得有竞争力的性能。我们利用在 ImageNet 数据集子集上通过严格消融研究发现的自定义对抗训练方案实现了该目标。ViTs 的规范训练方案建议采用强数据增强,部分是为了弥补注意力模块相较于卷积缺乏视觉归纳偏置的问题。我们表明,该方案用于对抗训练时性能次优。相反,我们发现省略所有重数据增强,并添加一些额外技巧(ε\varepsilon-warmup 与更大的权重衰减),可显著提升鲁棒 ViTs 的性能。我们表明,我们的方案可推广至不同类别的 ViT 架构以及全 ImageNet-1k 上的大规模模型。此外,为探究我们模型鲁棒性的原因,我们表明使用我们的方案在训练时更易生成强攻击,而这带来了测试时更好的鲁棒性。最后,我们进一步研究对抗训练的一个后果,提出一种量化对抗扰动的语义性质的方法,并强调其与模型鲁棒性的关联。总体而言,我们建议社区应避免将 ViTs 的规范训练方案套用于鲁棒训练,并在对抗训练背景下重新思考常见的训练选择。

关键词

引用

@article{arxiv.2209.07399,
  title  = {A Light Recipe to Train Robust Vision Transformers},
  author = {Edoardo Debenedetti and Vikash Sehwag and Prateek Mittal},
  journal= {arXiv preprint arXiv:2209.07399},
  year   = {2023}
}

备注

Camera-ready version for SaTML 2023, code available at https://github.com/dedeswim/vits-robustness-torch