中文

构建视觉-语言模型时哪些因素至关重要?

计算机视觉与模式识别 2024-05-06 v1 人工智能

摘要

视觉-语言模型 (VLM) 的日益增长的兴趣,得益于大型语言模型和视觉变换器的改进。尽管该领域已有大量文献,但我们注意到关于 VLM 设计的关键决策往往没有得到充分论证。我们认为,这些不受支持的决策会阻碍该领域的进步,使人们难以确定哪些选择会提高模型性能。为此,我们围绕预训练模型、架构选择、数据和训练方法开展了大量实验。我们的发现归纳包括开发 Idefics2——一个由 80 亿参数构成的高效基础 VLM。Idefics2 在各种多模态基准测试中实现了其规模类别内的最先进性能,甚至常常与规模为其四倍的模型持平。我们发布了该模型(基础版、指令版和聊天版)以及为其训练创建的数据集。

关键词

引用

@article{arxiv.2405.02246,
  title  = {What matters when building vision-language models?},
  author = {Hugo Laurençon and Léo Tronchon and Matthieu Cord and Victor Sanh},
  journal= {arXiv preprint arXiv:2405.02246},
  year   = {2024}
}