Mono-InternVL:推动单体化多模态大语言模型边界的端ogenous 视觉预训练
计算机视觉与模式识别
2025-03-14 v3 计算与语言
摘要
本文聚焦于集成视觉编码与语言解码于单个大语言模型(LLM)中的单体化多模态大语言模型(MLLMs)。具体而言,我们发现现有针对单体化 MLLMs 的预训练策略常常 suffer于优化不稳定或灾难性遗忘。为此,我们的核心思想是将新的视觉参数空间嵌入到预训练的 LLM 中,从而在冻结 LLM 的情况下稳定地学习来自噪声数据的视觉知识。基于此原理,我们提出Mono-InternVL,这是一种新的单体化 MLLM,能够无缝集成通过多模态混合专家结构实现的多个视觉专家。此外,我们提出一种创新的预训练策略以最大化Mono-InternVL的视觉能力,即端ogenous 视觉预训练(EViP)。具体而言,EViP被设计为视觉专家的渐进式学习过程,旨在充分挖掘来自噪声数据的视觉知识直至高质量数据。为验证我们的ethods,我们在16个基准上开展了大量实验。实验结果确认了Mono-InternVL在13个16个多模态基准中优于现有单体化 MLLMs的性能,例如在OCRBench上相较于Emu3提升80分。相对于模块化基线(即InternVL-1.5),Mono-InternVL仍保持相当的多模态性能,同时将首个标记延迟降低最高可达67%。代码和模型已发布于https://github.com/OpenGVLab/Mono-InternVL。
引用
@article{arxiv.2410.08202,
title = {Mono-InternVL: Pushing the Boundaries of Monolithic Multimodal Large Language Models with Endogenous Visual Pre-training},
author = {Gen Luo and Xue Yang and Wenhan Dou and Zhaokai Wang and Jiawen Liu and Jifeng Dai and Yu Qiao and Xizhou Zhu},
journal= {arXiv preprint arXiv:2410.08202},
year = {2025}
}
备注
Accepted by CVPR 2025