Transformer 是否比 CNN 更鲁棒?
计算机视觉与模式识别
2021-11-11 v1
摘要
Transformer 作为视觉识别的有力工具崭露头角。除了在广泛的视觉基准上展现出有竞争力的性能外,近期工作还认为 Transformer 比卷积神经网络(CNN)鲁棒得多。然而,令人惊讶的是,我们发现这些结论源于不公平的实验设置,其中 Transformer 与 CNN 在不同规模下进行比较,并采用了不同的训练框架。本文旨在提供 Transformer 与 CNN 之间首个公平且深入的对比,重点关注鲁棒性评估。通过统一的训练设置,我们首先挑战了先前关于对抗鲁棒性度量中 Transformer 优于 CNN 的观点。更令人惊讶的是,我们发现若 CNN 恰当采用 Transformer 的训练方案,其抵御对抗攻击的鲁棒性可轻易达到与 Transformer 相当的水平。而在分布外样本泛化方面,我们表明在(外部)大规模数据集上预训练并非使 Transformer 取得优于 CNN 性能的根本前提。此外,我们的消融实验表明,这种更强的泛化能力很大程度上受益于 Transformer 自身的类自注意力架构,而非其他训练设置。我们希望本工作能帮助学界更好地理解和评测 Transformer 与 CNN 的鲁棒性。代码与模型已公开于 https://github.com/ytongbai/ViTs-vs-CNNs。
引用
@article{arxiv.2111.05464,
title = {Are Transformers More Robust Than CNNs?},
author = {Yutong Bai and Jieru Mei and Alan Yuille and Cihang Xie},
journal= {arXiv preprint arXiv:2111.05464},
year = {2021}
}