中文

SOLO:用于可扩展视觉-语言建模的单一Transformer

计算机视觉与模式识别 2024-12-17 v3 计算与语言 机器学习

摘要

我们提出了SOLO,一种用于可扩展视觉-语言建模的单一Transformer。当前的大型视觉-语言模型(LVLMs),如LLaVA,大多采用异构架构,将预训练的视觉编码器与大型语言模型(LLMs)连接起来,以促进视觉识别和复杂推理。尽管通过相对轻量级的训练取得了显著性能,但我们识别出四个主要的可扩展性限制:(1)视觉能力受限于预训练的视觉编码器,其规模通常比LLMs小一个数量级。(2)异构架构使得使用已有的硬件和软件基础设施变得复杂。(3)在此类架构上研究缩放定律必须考虑三个独立的组件——视觉编码器、连接器和LLMs,这使分析复杂化。(4)使用现有的视觉编码器通常需要遵循预定义的图像输入预处理规范,例如,通过将输入重塑为固定分辨率的方形图像,这在处理和训练高分辨率图像或具有异常宽高比的图像时带来了困难。统一的单一Transformer架构,如SOLO,有效地解决了LVLMs中的这些可扩展性问题;然而,其在现代语境中的有限采用可能源于缺乏可靠的训练方案,该方案需要平衡两种模态并确保十亿级模型的稳定训练。在本文中,我们介绍了开发SOLO的第一个开源训练方案,SOLO是一个使用中等学术资源的开源7B LVLM。该训练方案包括从LLMs初始化、在ImageNet和网络规模数据上进行顺序预训练,以及在我们策划的高质量数据集上进行指令微调。在广泛的评估中,SOLO展现出与LLaVA-v1.5-7B相当的性能,特别是在视觉数学推理方面表现出色。

关键词

引用

@article{arxiv.2407.06438,
  title  = {SOLO: A Single Transformer for Scalable Vision-Language Modeling},
  author = {Yangyi Chen and Xingyao Wang and Hao Peng and Heng Ji},
  journal= {arXiv preprint arXiv:2407.06438},
  year   = {2024}
}

备注

Accepted to TMLR