超越语言建模:多模态预训练的探索
计算机视觉与模式识别
2026-03-04 v1
摘要
视觉世界为推动基础模型超越语言提供了关键维度。尽管对此方向的兴趣日益增长, 但原生多模态模型的设计空间仍不清晰。我们通过受控、从零开始的预训练实验, 通过隔离多模态预训练的影响因子, 而不受语言预训练的干扰, 来提供实证清晰度。我们采用 Transfusion 框架, 使用语言的 next-token 预测和视觉的扩散模型, 在包括文本、 视频、 图像-文本对以及动作条件视频等多样化数据上进行训练。我们的实验得出四项关键见解: (i) 表示自编码器(RAE) 在视觉理解和生成方面均表现优异, 提供了最佳的统一视觉表示; (ii) 视觉和语言数据互补, 对下游能力产生协同作用; (iii) 统一的多模态预训练自然导致世界建模, 能力从通用训练中涌现; (iv) 混合专家(MoE) 使多模态扩展高效且有效, 同时自然诱导模态专精。通过 IsoFLOP 分析, 我们计算了两种模态的比例定律, 并发现比例不对称:视觉数据需求显著高于语言。我们演示了 MoE 架构如何和谐化这种比例不对称, 通过为语言提供高模型容量, 同时容纳视觉数据密集型的本质, 为 truly 统一的多模态模型之路。
关键词
引用
@article{arxiv.2603.03276,
title = {Beyond Language Modeling: An Exploration of Multimodal Pretraining},
author = {Shengbang Tong and David Fan and John Nguyen and Ellis Brown and Gaoyue Zhou and Shengyi Qian and Boyang Zheng and Théophane Vallaeys and Junlin Han and Rob Fergus and Naila Murray and Marjan Ghazvininejad and Mike Lewis and Nicolas Ballas and Amir Bar and Michael Rabbat and Jakob Verbeek and Luke Zettlemoyer and Koustuv Sinha and Yann LeCun and Saining Xie},
journal= {arXiv preprint arXiv:2603.03276},
year = {2026}
}
备注
Project website at https://beyond-llms.github.io/