中文

引导 ViTs:迈向摆脱预训练视觉 Transformer

计算机视觉与模式识别 2022-03-29 v4 人工智能

摘要

近来,视觉 Transformer(ViTs)快速发展,并开始在计算机视觉(CV)领域挑战卷积神经网络(CNNs)的主导地位。随着通用 Transformer 架构取代卷积的硬编码归纳偏置,ViTs 已超越 CNNs,尤其在数据充足的情形下。然而,ViTs 易在小数据集上过拟合,从而依赖大规模预训练,耗费大量时间。本文致力于通过将 CNNs 的归纳偏置重新引入 ViTs,同时保留其网络架构以获取更高上限并设立更合适的优化目标,从而将 ViTs 从预训练中解放出来。首先,基于给定 ViT 设计具有归纳偏置的智能体 CNN。随后提出一种引导训练算法,以权重共享联合优化智能体与 ViT,在此过程中 ViT 从智能体的中间特征中学习归纳偏置。在 CIFAR-10/100 和 ImageNet-1k 上利用有限训练数据的大量实验显示出令人鼓舞的结果:归纳偏置帮助 ViTs 显著更快收敛,并以更少参数超越常规 CNNs。我们的代码公开于 https://github.com/zhfeing/Bootstrapping-ViTs-pytorch。

关键词

引用

@article{arxiv.2112.03552,
  title  = {Bootstrapping ViTs: Towards Liberating Vision Transformers from Pre-training},
  author = {Haofei Zhang and Jiarui Duan and Mengqi Xue and Jie Song and Li Sun and Mingli Song},
  journal= {arXiv preprint arXiv:2112.03552},
  year   = {2022}
}

备注

Accepted as a conference paper by CVPR2022