视觉 Transformer 是鲁棒的学习器
计算机视觉与模式识别
2021-12-07 v3 机器学习
摘要
Transformer 由多个自注意力层组成,有望成为一种适用于不同数据模态的通用学习基元,包括在计算机视觉中取得最先进(SOTA)标准精度的近期突破。其鲁棒性评估与归因在很大程度上仍未被探索。在本工作中,我们研究了视觉 Transformer(ViT)针对常见损坏与扰动、分布偏移以及自然对抗样本的鲁棒性。我们使用六个关于鲁棒分类的不同多样 ImageNet 数据集,对 ViT 模型与 SOTA 卷积神经网络(CNN)Big-Transfer 进行全面性能比较。通过一系列六个系统设计的实验,我们随后给出分析,提供定量与定性指示以解释为何 ViT 确实是更鲁棒的学习器。例如,在参数量更少且数据集与预训练组合相似的情况下,ViT 在 ImageNet-A 上给出 28.10% 的 top-1 精度,是可比较 BiT 变体的 4.3 倍。我们对图像掩码、傅里叶谱敏感度以及离散余弦能量谱上散布的分析揭示了 ViT 中导致鲁棒性提升的有趣性质。复现我们实验的代码见 https://git.io/J3VO0。
引用
@article{arxiv.2105.07581,
title = {Vision Transformers are Robust Learners},
author = {Sayak Paul and Pin-Yu Chen},
journal= {arXiv preprint arXiv:2105.07581},
year = {2021}
}
备注
Accepted to AAAI 2022. Sayak Paul and Pin-Yu Chen contributed equally to this work. Code available at https://github.com/sayakpaul/robustness-vit