迈向鲁棒视觉Transformer
计算机视觉与模式识别
2022-05-24 v4
摘要
近期 Vision Transformer (ViT) 及其改进变体的进展表明,基于自注意力的网络在大多数视觉任务中超越了传统的卷积神经网络 (CNNs)。然而,现有的 ViT 关注标准精度和计算成本,缺乏对模型鲁棒性和泛化能力内在影响的探究。在这项工作中,我们系统评估了 ViT 各组件对对抗样本、常见 corruptions 和分布偏移鲁棒性的影响。我们发现某些组件可能对鲁棒性有害。通过使用并组合鲁棒组件作为 ViT 的基本构件,我们提出了 Robust Vision Transformer (RVT),这是一种新的视觉 transformer,具有优越的性能和强鲁棒性。我们进一步提出两种称为位置感知注意力缩放和分块增强的即插即用技术来增强我们的 RVT,缩写为 RVT*。在 ImageNet 和六个鲁棒性基准上的实验结果表明,与之前的 ViT 和 state-of-the-art CNNs 相比,RVT 具有先进的鲁棒性和泛化能力。此外,RVT-S* 还在包括 ImageNet-C 和 ImageNet-Sketch 在内的多个鲁棒性排行榜上取得 Top-1 排名。代码将发布于 \url{https://github.com/alibaba/easyrobust}。
引用
@article{arxiv.2105.07926,
title = {Towards Robust Vision Transformer},
author = {Xiaofeng Mao and Gege Qi and Yuefeng Chen and Xiaodan Li and Ranjie Duan and Shaokai Ye and Yuan He and Hui Xue},
journal= {arXiv preprint arXiv:2105.07926},
year = {2022}
}
备注
Accepted to CVPR 2022, https://github.com/alibaba/easyrobust