NaViL:数据受限下本质多模态大语言模型的扩展属性重审
计算机视觉与模式识别
2025-10-10 v1
摘要
现有的多模态大语言模型(MLLM)事实上采用分离式训练范式,即通过连续多模态预训练将预训练视觉编码器与预训练 LLM 连接起来。然而,这种范式下的多模态扩展属性难以探索,因其训练方式是分离的。本文聚焦于以端到端方式进行本质 MLLM 训练,系统研究其设计空间和在数据受限实际场景下的扩展属性。通过对各种 MLLM 选择项的深入研究,我们获得了在性能与训练成本之间取得最佳平衡的优化元架构。随后,我们进一步探索本质 MLLM 的扩展属性,指出视觉编码器与 LLM 之间的正相关扩展关系。基于这些发现,我们提出了称为 NaViL 的本质 MLLM,配合一种简单且成本效益高的配方。14 个多模态基准测试的实验结果表明,NaViL 在性能上与现有 MLLM 具有竞争力。此外,我们的发现与结果为未来本质 MLLM 的研究提供了深入见解。
引用
@article{arxiv.2510.08565,
title = {NaViL: Rethinking Scaling Properties of Native Multimodal Large Language Models under Data Constraints},
author = {Changyao Tian and Hao Li and Gen Luo and Xizhou Zhu and Weijie Su and Hanming Deng and Jinguo Zhu and Jie Shao and Ziran Zhu and Yunpeng Liu and Lewei Lu and Wenhai Wang and Hongsheng Li and Jifeng Dai},
journal= {arXiv preprint arXiv:2510.08565},
year = {2025}
}
备注
Accepted by NeurIPS 2025. 22 pages, link: https://github.com/OpenGVLab/NaViL