中文

Mono-InternVL-1.5:更便宜且更快速的单体化多模态大语言模型

计算机视觉与模式识别 2025-07-18 v1 计算与语言

摘要

本文聚焦于单体化多模态大语言模型(MLLM),其将视觉编码与语言解码集成到单个模型中。现有单体化 MLLM 的结构和预训练策略常常面临优化不稳定和灾难性遗忘的问题。为此,我们的核心思想是将新的视觉参数空间嵌入到预训练的 LLM 中,通过 delta 调谐实现对噪声数据的稳定视觉知识学习。基于此原理,我们首先引入 Mono-InternVL,这是一个先进的单体化 MLLM,通过多模态 mixture-of-experts 架构集成一组视觉专家。此外,我们设计了 innovative Endogenous Visual Pre-training(EViP)以 progressive learning 方式最大化 Mono-InternVL 的视觉能力。Mono-InternVL 在性能上与现有 MLLM 相当,但也导致相对高昂的数据成本。因此,我们进一步提出 Mono-InternVL-1.5,这是一个更便宜且更强大的单体化 MLLM,配备改进版的 EViP(EViP++)。EViP++ 为 Mono-InternVL-1.5 引入额外的视觉注意力专家,并以高效方式重新组织预训练过程。在推理期间,包括用于加速其 MoE 操作的 fused CUDA kernel。通过上述设计,Mono-InternVL-1.5 在训练和推理成本上显著降低,同时仍保持与 Mono-InternVL 相当的性能。为评估我们的方法,我们在 15 个基准上开展了大量实验。结果表明,Mono-InternVL 在 12 个基准中超越了现有的单体化 MLLM,例如相对于 Emu3 在 OCRBench 上提升 114 分。与其模块化对应物(即 InternVL-1.5)相比,Mono-InternVL-1.5 在保持相似多模态性能的同时,将首个 token 延迟降低最高可达 69%。代码和模型已发布于 https://github.com/OpenGVLab/Mono-InternVL。

关键词

引用

@article{arxiv.2507.12566,
  title  = {Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models},
  author = {Gen Luo and Wenhan Dou and Wenhao Li and Zhaokai Wang and Xue Yang and Changyao Tian and Hao Li and Weiyun Wang and Wenhai Wang and Xizhou Zhu and Yu Qiao and Jifeng Dai},
  journal= {arXiv preprint arXiv:2507.12566},
  year   = {2025}
}