中文

HaploVL: 多模态理解的单Transformer基线模型

计算与语言 2025-03-20 v1 计算机视觉与模式识别

摘要

大型语言模型(LLM)的最新进展显著推动了大多模态模型(LMM)的发展,凸显了通用智能助手的潜力。然而,大多数LMM分别对视觉和文本模态进行建模,这促使了使用单一Transformer的原生LMM的研究。尽管前景广阔,但这些原生模型资源密集,且性能往往与其组合式对应模型存在差距。为缓解这一问题,我们提出了一种简单而高效的方法,在单一Transformer中构建原生端到端大多模态模型的基线。首先,我们提出了一种新的早期融合LMM,可在早期阶段融合多模态输入,并以自回归方式响应视觉指令。其次,我们为所提出的模型设计了一种高效的训练方案,利用预训练模型的先验知识,解决了性能限制和资源消耗的挑战。所提出的模型在使用单一Transformer的LMM中表现出优越性能,并显著缩小了与组合式LMM之间的性能差距。

关键词

引用

@article{arxiv.2503.14694,
  title  = {HaploVL: A Single-Transformer Baseline for Multi-Modal Understanding},
  author = {Rui Yang and Lin Song and Yicheng Xiao and Runhui Huang and Yixiao Ge and Ying Shan and Hengshuang Zhao},
  journal= {arXiv preprint arXiv:2503.14694},
  year   = {2025}
}