中文

DeiT III:ViT 的复仇

计算机视觉与模式识别 2022-04-15 v1

摘要

Vision Transformer (ViT) 是一种简单的神经架构,可用于服务若干计算机视觉任务。与近期那些融入关于输入数据或特定任务先验的架构不同,它内置的架构先验有限。近期工作表明 ViT 受益于自监督预训练,特别是 BeiT 这类类 BERT 的预训练。本文中,我们重访 ViT 的有监督训练。我们的流程基于并简化了一个为训练 ResNet-50 引入的方案。它包含一种仅含 3 种增强的新颖简单数据增强流程,更接近于自监督学习中的做法。我们在图像分类(ImageNet-1k,以及有/无 ImageNet-21k 预训练)、迁移学习与语义分割上的评估表明,我们的流程大幅优于此前针对 ViT 的全监督训练方案。它还揭示出,我们以有监督训练的 ViT 性能可与更近期的架构相媲美。我们的结果可作为近期在 ViT 上展示的自监督方法的更好基线。

关键词

引用

@article{arxiv.2204.07118,
  title  = {DeiT III: Revenge of the ViT},
  author = {Hugo Touvron and Matthieu Cord and Hervé Jégou},
  journal= {arXiv preprint arXiv:2204.07118},
  year   = {2022}
}