中文

大型视觉编码器的多模态自回归预训练

计算机视觉与模式识别 2024-11-22 v1 机器学习

摘要

我们提出了一种大型视觉编码器的新型预训练方法。基于最近在视觉模型自回归预训练方面的进展,我们将该框架扩展到多模态设置,即图像和文本。本文介绍了 AIMV2,一系列通用视觉编码器,具有简单易行的预训练过程、可扩展性和在多种下游任务上的卓越性能。这一成就通过将视觉编码器与多模态解码器配对实现,后者自回归生成原始图像块和文本标记。我们的编码器不仅在多模态评估中表现出色,还在视觉基准测试中表现突出,包括 localisation、grounding 和 classification。值得注意的是,我们的 AIMV2-3B 编码器在冻结主干网络的情况下即可在 ImageNet-1k 上实现 89.5% 的准确率。此外,AIMV2 在多样化的设置下持续超过最新的对比模型(如 CLIP、SigLIP)进行多模态图像理解。

关键词

引用

@article{arxiv.2411.14402,
  title  = {Multimodal Autoregressive Pre-training of Large Vision Encoders},
  author = {Enrico Fini and Mustafa Shukor and Xiujun Li and Philipp Dufter and Michal Klein and David Haldimann and Sai Aitharaju and Victor Guilherme Turrisi da Costa and Louis Béthune and Zhe Gan and Alexander T Toshev and Marcin Eichner and Moin Nabi and Yinfei Yang and Joshua M. Susskind and Alaaeldin El-Nouby},
  journal= {arXiv preprint arXiv:2411.14402},
  year   = {2024}
}

备注

https://github.com/apple/ml-aim