如何在小规模数据集上训练视觉 Transformer?
计算机视觉与模式识别
2022-10-14 v1
摘要
Vision Transformer (ViT) 是一种与卷积神经网络截然不同的架构,具有设计简洁、鲁棒性以及在许多视觉任务上达到最先进性能等多重优势。然而,与卷积神经网络相反,Vision Transformer 缺乏固有的归纳偏置。因此,此类模型的成功训练主要归因于在大规模数据集(如含 1.2M 图像的 ImageNet 或含 300M 图像的 JFT)上的预训练。这阻碍了 Vision Transformer 直接适配于小规模数据集。本工作中,我们展示自监督归纳偏置可直接从小规模数据集学习,并作为微调的有效权重初始化方案。这使得无需大规模预训练、改动模型架构或损失函数即可训练这些模型。我们给出了详尽的实验,在五个小规模数据集(包括 CIFAR10/100、CINIC10、SVHN、Tiny-ImageNet)以及两个细粒度数据集:Aircraft 和 Cars 上成功训练整体式与非整体式 Vision Transformer。我们的方法一致地提升了 Vision Transformer 的性能,同时保留其诸如关注显著区域与更高鲁棒性等性质。我们的代码与预训练模型可见于:https://github.com/hananshafi/vits-for-small-scale-datasets。
引用
@article{arxiv.2210.07240,
title = {How to Train Vision Transformer on Small-scale Datasets?},
author = {Hanan Gani and Muzammal Naseer and Mohammad Yaqub},
journal= {arXiv preprint arXiv:2210.07240},
year = {2022}
}
备注
Accepted at BMVC 2022