中文

仅用 2040 张图像训练视觉 Transformer

计算机视觉与模式识别 2022-01-27 v1 人工智能

摘要

Vision Transformers (ViTs) 正作为卷积神经网络 (CNNs) 在视觉识别中的替代方案而出现。它们取得了与 CNNs 相竞争的结果,但缺乏典型的卷积归纳偏置使得它们比常见 CNNs 更依赖数据。它们通常在 JFT-300M 或至少 ImageNet 上预训练,且很少有研究关注用有限数据训练 ViTs。在本文中,我们探究如何用有限数据(例如 2040 张图像)训练 ViTs。我们给出理论分析,表明我们的方法(基于参数化实例判别)优于其他方法,因为它能同时捕捉特征对齐与实例相似性。在各种 ViT 骨干网络下,我们在 7 个小数据集上从头训练时取得了 state-of-the-art 结果。我们还探究了小数据集的迁移能力,发现从小数据集学习到的表征甚至能改进大规模的 ImageNet 训练。

关键词

引用

@article{arxiv.2201.10728,
  title  = {Training Vision Transformers with Only 2040 Images},
  author = {Yun-Hao Cao and Hao Yu and Jianxin Wu},
  journal= {arXiv preprint arXiv:2201.10728},
  year   = {2022}
}

备注

11 pages