CNN 能否比 Transformer 更鲁棒?
计算机视觉与模式识别
2023-03-07 v2
摘要
视觉 Transformer 近期的成功动摇了卷积神经网络(CNNs)在图像识别领域长达十年的主导地位。具体而言,关于分布外样本的鲁棒性,近期研究发现无论训练设置如何,Transformer 本质上比 CNN 更鲁棒。此外,人们认为 Transformer 的这种优越性很大程度上应归功于其类自注意力架构本身。在本文中,我们通过仔细审视 Transformer 的设计来质疑该信念。我们的发现带来了三种极其有效且简单到可用几行代码实现的提升鲁棒性的架构设计,即 a) 将输入图像分块(patchifying),b) 增大核尺寸,以及 c) 减少激活层与归一化层。将这些组件结合,我们能够构建无任何类注意力操作、与 Transformer 一样鲁棒甚至更鲁棒的纯 CNN 架构。我们希望本工作能帮助社区更好地理解鲁棒神经架构的设计。代码已公开于 https://github.com/UCSC-VLAA/RobustCNN。
引用
@article{arxiv.2206.03452,
title = {Can CNNs Be More Robust Than Transformers?},
author = {Zeyu Wang and Yutong Bai and Yuyin Zhou and Cihang Xie},
journal= {arXiv preprint arXiv:2206.03452},
year = {2023}
}
备注
ICLR2023. Code is available at https://github.com/UCSC-VLAA/RobustCNN