中文

原生多模态模型的缩放定律

计算机视觉与模式识别 2025-08-12 v4

摘要

构建能够通过多模态信号有效感知世界的通用模型一直是一个长期目标。当前的方法涉及集成单独预训练的组件,例如将视觉编码器连接到 LLM 并继续进行多模态训练。虽然这些方法展现出显著的样本效率,但这种后期融合架构是否具有内在优势仍是一个悬而未决的问题。在这项工作中,我们重新审视了原生多模态模型(NMM)的架构设计——这些模型从一开始就在所有模态上进行训练——并进行了一项广泛的缩放定律研究,涵盖了具有不同架构和训练混合的 457 个训练模型。我们的研究表明,后期融合架构相比于不依赖图像编码器或分词器的早期融合架构并没有内在优势。相反,早期融合在较低参数量下表现出更强的性能,训练效率更高,且更易于部署。受早期融合架构优异性能的启发,我们展示了引入混合专家模型使模型能够学习特定于模态的权重,从而显著提升性能。

关键词

引用

@article{arxiv.2504.07951,
  title  = {Scaling Laws for Native Multimodal Models},
  author = {Mustafa Shukor and Enrico Fini and Victor Guilherme Turrisi da Costa and Matthieu Cord and Joshua Susskind and Alaaeldin El-Nouby},
  journal= {arXiv preprint arXiv:2504.07951},
  year   = {2025}
}

备注

ICCV 2025 (Oral). 28 figures, 13 tables