中文

将视觉Transformer扩展至220亿参数

计算机视觉与模式识别 2023-02-13 v1 人工智能 机器学习

摘要

Transformer的扩展推动了语言模型能力的突破。目前,最大的大语言模型(LLMs)包含超过100B参数。Vision Transformers(ViT)已将相同架构引入图像和视频建模,但这些模型尚未成功扩展到近乎相同的程度;最大的稠密ViT包含4B参数(Chen等人,2022)。我们提出了一种高效且稳定的22B参数ViT(ViT-22B)训练方案,并对所得模型进行了广泛的实验。在下游任务评估时(通常在冻结特征上使用轻量线性模型),ViT-22B展现出随规模增长的性能提升。我们进一步观察到规模带来的其他有趣益处,包括公平性与性能之间改进的权衡、在形状/纹理偏置方面与人类视觉感知的最先进对齐,以及改进的鲁棒性。ViT-22B展示了视觉中“类LLM”扩展的潜力,并为实现该目标提供了关键步骤。

关键词

引用

@article{arxiv.2302.05442,
  title  = {Scaling Vision Transformers to 22 Billion Parameters},
  author = {Mostafa Dehghani and Josip Djolonga and Basil Mustafa and Piotr Padlewski and Jonathan Heek and Justin Gilmer and Andreas Steiner and Mathilde Caron and Robert Geirhos and Ibrahim Alabdulmohsin and Rodolphe Jenatton and Lucas Beyer and Michael Tschannen and Anurag Arnab and Xiao Wang and Carlos Riquelme and Matthias Minderer and Joan Puigcerver and Utku Evci and Manoj Kumar and Sjoerd van Steenkiste and Gamaleldin F. Elsayed and Aravindh Mahendran and Fisher Yu and Avital Oliver and Fantine Huot and Jasmijn Bastings and Mark Patrick Collier and Alexey Gritsenko and Vighnesh Birodkar and Cristina Vasconcelos and Yi Tay and Thomas Mensink and Alexander Kolesnikov and Filip Pavetić and Dustin Tran and Thomas Kipf and Mario Lučić and Xiaohua Zhai and Daniel Keysers and Jeremiah Harmsen and Neil Houlsby},
  journal= {arXiv preprint arXiv:2302.05442},
  year   = {2023}
}