中文

缩放视觉Transformer

计算机视觉与模式识别 2022-06-22 v2 人工智能 机器学习

摘要

基于注意力的神经网络,如视觉Transformer(ViT),近期在许多计算机视觉基准上取得了最先进的结果。规模是获得优异结果的主要要素,因此,理解模型的缩放特性是有效设计下一代模型的关键。虽然Transformer语言模型的缩放规律已被研究,但视觉Transformer如何缩放尚属未知。为此,我们对ViT模型和数据进行了向上与向下的缩放,并刻画了错误率、数据与计算量之间的关系。在此过程中,我们改进了ViT的架构与训练,降低了内存消耗并提升了所得模型的准确率。作为结果,我们成功训练了一个具有二十亿参数的ViT模型,在ImageNet上以90.45%的top-1准确率刷新了最先进水平。该模型在少样本迁移中也表现良好,例如,在ImageNet上每类仅用10个样本即达到84.86%的top-1准确率。

关键词

引用

@article{arxiv.2106.04560,
  title  = {Scaling Vision Transformers},
  author = {Xiaohua Zhai and Alexander Kolesnikov and Neil Houlsby and Lucas Beyer},
  journal= {arXiv preprint arXiv:2106.04560},
  year   = {2022}
}

备注

Xiaohua, Alex, and Lucas contributed equally; CVPR 2022