关于视觉变换器的对抗鲁棒性
计算机视觉与模式识别
2022-11-04 v3 人工智能
机器学习
摘要
在推动自然语言处理与理解取得进展之后,变换器有望给计算机视觉带来革命性变化。本工作对视觉变换器(ViTs)针对对抗扰动的鲁棒性提供了全面研究。在各种白盒与迁移攻击设定下测试,我们发现与MLP-Mixer及包括ConvNeXt在内的卷积神经网络(CNNs)相比,ViTs具有更好的对抗鲁棒性,且该观察对认证鲁棒性同样成立。通过频率分析与特征可视化,我们总结以下促成ViTs鲁棒性提升的主要观察:1) ViTs学习的特征含有更少具有伪相关的低频模式,这有助于解释为何ViTs对高频扰动的敏感度低于CNNs与MLP-Mixer,且模型学习高频特征的程度与其针对不同基于频率的扰动的鲁棒性高度相关。2) 在ViTs中引入卷积或tokens-to-token块以学习高频特征可提升分类精度,但代价是对抗鲁棒性下降。3) 借鉴ViTs技术(包括激活函数、层归一化、更大核尺寸以模仿全局注意力、将图像分块作为输入等)的现代CNN设计,可不仅在性能上,也在认证与经验对抗鲁棒性上缩小ViTs与CNNs间的性能差距。此外,我们展示对抗训练同样适用于ViT以训练鲁棒模型,且锐度感知最小化也可帮助提升鲁棒性,而在更大数据集上用干净图像预训练并未显著改善对抗鲁棒性。
引用
@article{arxiv.2103.15670,
title = {On the Adversarial Robustness of Vision Transformers},
author = {Rulin Shao and Zhouxing Shi and Jinfeng Yi and Pin-Yu Chen and Cho-Jui Hsieh},
journal= {arXiv preprint arXiv:2103.15670},
year = {2022}
}
备注
Published in Transactions on Machine Learning Research (TMLR). Codes available at https://github.com/RulinShao/on-the-adversarial-robustness-of-visual-transformer