中文

离散表示增强视觉Transformer的鲁棒性

计算机视觉与模式识别 2022-04-05 v2

摘要

Vision Transformer(ViT)正成为图像识别的最先进架构。尽管近期研究表明ViT比其卷积对应物更鲁棒,我们的实验发现,在ImageNet上训练的ViT过度依赖局部纹理且未能充分利用形状信息。因此ViT难以泛化到分布外真实世界数据。为解决该缺陷,我们通过对ViT输入层添加由向量量化编码器产生的离散令牌,提出一种简单有效的架构修改。与标准连续像素令牌不同,离散令牌在小扰动下不变且各自包含较少信息,这促使ViT学习不变的全局信息。实验结果表明,在四种架构变体上添加离散表示,在七个ImageNet鲁棒性基准上使ViT鲁棒性提升高达12%,同时保持ImageNet上的性能。

关键词

引用

@article{arxiv.2111.10493,
  title  = {Discrete Representations Strengthen Vision Transformer Robustness},
  author = {Chengzhi Mao and Lu Jiang and Mostafa Dehghani and Carl Vondrick and Rahul Sukthankar and Irfan Essa},
  journal= {arXiv preprint arXiv:2111.10493},
  year   = {2022}
}