中文

SpecFormer:通过最大奇异值惩罚守护视觉Transformer的鲁棒性

计算机视觉与模式识别 2024-07-16 v2 机器学习

摘要

视觉Transformer(ViTs)因其高性能在计算机视觉领域得到越来越广泛的应用,但其对对抗攻击的脆弱性令人担忧。现有方法缺乏坚实的理论基础,主要集中在经验性的训练调整上。本研究引入了SpecFormer,旨在从理论上增强ViT抵御对抗攻击的能力。我们为自注意力层建立了局部Lipschitz界限,并提出了最大奇异值惩罚(MSVP)来精确管理这些界限。通过将MSVP纳入ViT的注意力层,我们在不牺牲训练效率的情况下增强了模型的鲁棒性。由此产生的模型SpecFormer在防御对抗攻击方面优于其他最先进的模型,这一点通过在CIFAR和ImageNet数据集上的实验得到了证明。代码已发布于https://github.com/microsoft/robustlearn。

关键词

引用

@article{arxiv.2402.03317,
  title  = {SpecFormer: Guarding Vision Transformer Robustness via Maximum Singular Value Penalization},
  author = {Xixu Hu and Runkai Zheng and Jindong Wang and Cheuk Hang Leung and Qi Wu and Xing Xie},
  journal= {arXiv preprint arXiv:2402.03317},
  year   = {2024}
}

备注

Accepted by ECCV 2024; 27 pages; code is at: https://github.com/microsoft/robustlearn