中文

简约的可扩展性:基于单一 Transformer 的视觉语言学习实证分析

计算机视觉与模式识别 2025-04-15 v1

摘要

本文介绍了 SAIL(Single trAnsformer as unified vIsion-Language Model),一种单一 Transformer 统一的多模态大语言模型(MLLM),将原始像素编码和语言解码集成到单一架构中。与现有的模块化 MLLM 依赖预训练视觉 Transformer(ViT)不同,SAIL 消除了需要单独视觉编码器的需求,呈现更简洁的架构设计。不引入新颖的架构组件,SAIL 调整了混合注意力机制和多模态位置编码,以更好地适应视觉和文本模态的独特特征。我们系统比较了 SAIL 的属性——包括可扩展性、跨模态信息流模式和视觉表征能力——与模块化 MLLM 的性能。通过扩展训练数据和模型规模,SAIL 达到了与模块化 MLLM 相当的性能。值得注意的是,去除预训练 ViT 组件后,SAIL 的可扩展性得到增强,结果呈现出显著不同的跨模态信息流模式。此外,SAIL 展示了强大的视觉表征能力,在诸如语义分割等视觉任务上取得了与 ViT-22B 相当的结果。代码和模型已在 https://github.com/bytedance/SAIL 提供。

关键词

引用

@article{arxiv.2504.10462,
  title  = {The Scalability of Simplicity: Empirical Analysis of Vision-Language Learning with a Single Transformer},
  author = {Weixian Lei and Jiacong Wang and Haochen Wang and Xiangtai Li and Jun Hao Liew and Jiashi Feng and Zilong Huang},
  journal= {arXiv preprint arXiv:2504.10462},
  year   = {2025}
}