SpecFormer:通过最大奇异值惩罚守护视觉Transformer的鲁棒性
计算机视觉与模式识别
2024-07-16 v2 机器学习
摘要
视觉Transformer(ViTs)因其高性能在计算机视觉领域得到越来越广泛的应用,但其对对抗攻击的脆弱性令人担忧。现有方法缺乏坚实的理论基础,主要集中在经验性的训练调整上。本研究引入了SpecFormer,旨在从理论上增强ViT抵御对抗攻击的能力。我们为自注意力层建立了局部Lipschitz界限,并提出了最大奇异值惩罚(MSVP)来精确管理这些界限。通过将MSVP纳入ViT的注意力层,我们在不牺牲训练效率的情况下增强了模型的鲁棒性。由此产生的模型SpecFormer在防御对抗攻击方面优于其他最先进的模型,这一点通过在CIFAR和ImageNet数据集上的实验得到了证明。代码已发布于https://github.com/microsoft/robustlearn。
引用
@article{arxiv.2402.03317,
title = {SpecFormer: Guarding Vision Transformer Robustness via Maximum Singular Value Penalization},
author = {Xixu Hu and Runkai Zheng and Jindong Wang and Cheuk Hang Leung and Qi Wu and Xing Xie},
journal= {arXiv preprint arXiv:2402.03317},
year = {2024}
}
备注
Accepted by ECCV 2024; 27 pages; code is at: https://github.com/microsoft/robustlearn