中文

ConvNets与Transformers:谁的视觉表征更具可迁移性?

计算机视觉与模式识别 2021-08-18 v2

摘要

视觉transformers已引起计算机视觉研究人员的广泛关注,因为它们不受ConvNets空间归纳偏置的限制。然而,尽管基于Transformer的主干在ImageNet分类上已取得很大进展,仍不清楚所学表征是否像ConvNets的特征一样可迁移甚至更具可迁移性。为阐明这一点,我们系统地研究了ConvNets与视觉transformers在15项单任务与多任务性能评估中的迁移学习能力。鉴于预训练模型性能与迁移学习的强相关性,我们纳入了2个残差ConvNets(即R-101x3与R-152x4)和3个基于Transformer的视觉主干(即ViT-B、ViT-L与Swin-B),它们在ImageNet上具有接近的错误率,表明在下游数据集上相似的迁移学习性能。我们观察到基于Transformer的主干在15项中的13项下游任务上具有一致优势,包括但不限于细粒度分类、场景识别(分类、分割与深度估计)、开放域分类、人脸识别等。更具体地,我们发现两个ViT模型严重依赖整个网络微调以实现性能提升,而Swin Transformer无此要求。此外,视觉transformers在多任务学习中表现得更鲁棒,即在处理互益任务时带来更多改进,并在应对不相关任务时减少性能损失。我们希望我们的发现能促进未来对视觉transformers的探索与利用。

关键词

引用

@article{arxiv.2108.05305,
  title  = {ConvNets vs. Transformers: Whose Visual Representations are More Transferable?},
  author = {Hong-Yu Zhou and Chixiang Lu and Sibei Yang and Yizhou Yu},
  journal= {arXiv preprint arXiv:2108.05305},
  year   = {2021}
}

备注

Accepted to appear in ICCV workshop on Multi-Task Learning in Computer Vision (DeepMTL)