中文

通过微调单个可训练块探究视觉Transformer与CNN的迁移学习能力

计算机视觉与模式识别 2021-10-12 v1 人工智能

摘要

在计算机视觉领域的最近进展中,基于Transformer的架构使用日益增多。它们在准确率上超越了CNN架构所保持的state-of-the-art,但另一方面,它们从零开始训练的计算开销非常庞大。由于这些模型在计算机视觉领域相当新颖,有必要研究其迁移学习能力并与CNN进行比较,以便理解在具有小数据的真实世界问题中哪种架构更优。在这项工作中,我们遵循一种简单但受限的方法,在CIFAR-10上微调在ImageNet1K上预训练的CNN和Transformer模型,并相互比较。我们仅解冻模型的最后一个transformer/encoder或最后一个卷积块,并冻结其之前的所有层,同时在末端添加一个简单的MLP用于分类。这一简单修改使我们能够使用这两种神经网络的原始学习权重。从实验中我们发现,基于transformer的架构不仅比CNN达到更高的准确率,而且某些transformer甚至以约少4倍的参数量实现了这一成就。

关键词

引用

@article{arxiv.2110.05270,
  title  = {Investigating Transfer Learning Capabilities of Vision Transformers and CNNs by Fine-Tuning a Single Trainable Block},
  author = {Durvesh Malpure and Onkar Litake and Rajesh Ingle},
  journal= {arXiv preprint arXiv:2110.05270},
  year   = {2021}
}

备注

8 pages, 4 figures