中文

InternVL3: 探索开源多模态模型的高级训练与测试时策略

计算机视觉与模式识别 2025-04-22 v3

摘要

我们介绍 InternVL3,这是 InternVL 系列的重大进展,具有原生多模态预训练范式。不同于将文本-only 大语言模型 (LLM) 适配为支持视觉输入的多模态大语言模型 (MLLM),InternVL3 在单一预训练阶段通过多样化的多模态数据和纯文本语料库同时获得多模态和语言能力。这种统一的训练范式有效解决了传统 MLLM 后处理训练管道中常见的复杂性和对齐挑战。为进一步提升性能和可扩展性,InternVL3 采用可变视觉位置编码 (V2PE) 以支持扩展的多模态上下文,采用监督微调 (SFT) 和混合偏好优化 (MPO) 等先进的后训练技术,并采用优化的测试时规模策略。广泛的经验评估表明,InternVL3 在广泛的多模态任务上均实现卓越性能。特别是,InternVL3-78B 在 MMMU benchmark 上取得 72.2 分,刷新了开源 MLLM 的最新纪录。其性能在很大程度上与 ChatGPT-4o、Claude 3.5 Sonnet 和 Gemini 2.5 Pro 等领先专有模型相抗衡,同时保持了强大的纯语言专业能力。为践行开源科学原则,我们将公开发布训练数据和模型权重,以促进下一代 MLLM 的进一步研究与发展。

关键词

引用

@article{arxiv.2504.10479,
  title  = {InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models},
  author = {Jinguo Zhu and Weiyun Wang and Zhe Chen and Zhaoyang Liu and Shenglong Ye and Lixin Gu and Hao Tian and Yuchen Duan and Weijie Su and Jie Shao and Zhangwei Gao and Erfei Cui and Xuehui Wang and Yue Cao and Yangzhou Liu and Xingguang Wei and Hongjie Zhang and Haomin Wang and Weiye Xu and Hao Li and Jiahao Wang and Nianchen Deng and Songze Li and Yinan He and Tan Jiang and Jiapeng Luo and Yi Wang and Conghui He and Botian Shi and Xingcheng Zhang and Wenqi Shao and Junjun He and Yingtong Xiong and Wenwen Qu and Peng Sun and Penglong Jiao and Han Lv and Lijun Wu and Kaipeng Zhang and Huipeng Deng and Jiaye Ge and Kai Chen and Limin Wang and Min Dou and Lewei Lu and Xizhou Zhu and Tong Lu and Dahua Lin and Yu Qiao and Jifeng Dai and Wenhai Wang},
  journal= {arXiv preprint arXiv:2504.10479},
  year   = {2025}
}

备注

Technical Report