中文

当对抗训练遇见视觉 Transformer:从训练到架构的经验方法

计算机视觉与模式识别 2022-10-17 v1 机器学习

摘要

视觉 Transformer(ViTs)近期在广泛的视觉任务中取得了有竞争力的性能。遗憾的是,在流行的威胁模型下,自然训练的 ViTs 被证明所提供的对抗鲁棒性并不优于卷积神经网络(CNNs)。ViTs 仍需对抗训练以防御此类对抗攻击。在本文中,我们通过对各基准数据集上多种训练技术的大量评估,首次对 ViTs 的对抗训练经验方法进行了全面研究。我们发现预训练与 SGD 优化器对 ViTs 的对抗训练是必要的。进一步将 ViT 视为一种新型模型架构,我们从独特架构组件的角度考察其对抗鲁棒性。我们发现,在对抗训练期间随机掩蔽来自某些注意力块的梯度或掩蔽某些图块上的扰动时,ViTs 的对抗鲁棒性可显著提升,这可能潜在地开启一系列探索 ViTs 等新建模型中架构信息的工作。我们的代码可在 https://github.com/mo666666/When-Adversarial-Training-Meets-Vision-Transformers 获取。

关键词

引用

@article{arxiv.2210.07540,
  title  = {When Adversarial Training Meets Vision Transformers: Recipes from Training to Architecture},
  author = {Yichuan Mo and Dongxian Wu and Yifei Wang and Yiwen Guo and Yisen Wang},
  journal= {arXiv preprint arXiv:2210.07540},
  year   = {2022}
}