MindGPT-4ov:通过多阶段后训练范式增强的多模态大语言模型
计算机视觉与模式识别
2025-12-04 v2
摘要
我们提出MindGPT-4ov,一种多模态大语言模型(MLLM),它引入了一种涵盖数据生成、模型训练与高效部署的通用后训练范式。该模型以低成本在多个基准测试上取得了最先进的性能,有效增强了MLLM的基础能力和泛化能力。本工作聚焦于数据构建、监督微调策略和多模态强化学习方法,提出了三项关键创新:(1)一种基于信息密度的数据生成方案,结合双维度树状标签系统,实现高质量跨域数据的自动生成。(2)一种协作式课程监督微调方法,在注入领域特定知识与保持通用能力之间取得平衡。(3)一种混合强化学习范式,在增强推理能力的同时,同时处理多样性探索、多模态感知保持和响应简洁性等多目标优化。此外,我们实施了一系列基础设施优化,如5D并行训练、算子优化和推理量化,以提升训练与推理效率并降低领域适配成本。实验结果表明,MindGPT-4ov模型在MMBench、MMStar、MathVision和MathVista等基准测试上优于最先进模型。此外,MindGPT-4ov在垂直领域任务中也展现出优越的用户体验,实现了从学术研究到工业部署的无缝衔接。MindGPT-4ov提供了一种适用于广泛MLLM的通用后训练范式。基于Qwen3-VL的变体模型权重、数据集和代码将近期开源,以支持社区对MLLM的发展。
引用
@article{arxiv.2512.02895,
title = {MindGPT-4ov: An Enhanced MLLM via a Multi-Stage Post-Training Paradigm},
author = {Wei Chen and Chaoqun Du and Feng Gu and Wei He and Qizhen Li and Zide Liu and Xuhao Pan and Chang Ren and Xudong Rao and Chenfeng Wang and Tao Wei and Chengjun Yu and Pengfei Yu and Yufei Zheng and Chunpeng Zhou and Pan Zhou and Xuhan Zhu},
journal= {arXiv preprint arXiv:2512.02895},
year = {2025}
}
备注
33 pages, 14 figures