中文

MindVL: 面向Ascend NPU上高效且有效训练多模态大语言模型

计算机视觉与模式识别 2025-10-01 v3 人工智能 计算与语言 图像与视频处理

摘要

我们提出MindVL,一个在Ascend NPU上训练的多模态大语言模型(MLLM)。最先进MLLM的训练通常局限于有限的硬件平台,并严重依赖大量未公开的数据方案,这阻碍了可复现性和开放研究。为了改变Ascend硬件不适合高效全阶段MLLM训练的普遍认知,我们引入了MindSpeed-MLLM,一个高度高效的训练框架,支持在Ascend硬件上对大规模密集模型和混合专家模型进行稳定且高性能的训练。在此基础上,我们对所有训练阶段的数据生产方法和混合策略提供了系统且开放的描述。此外,我们提出了MindVL,一个在Ascend NPU上端到端训练的数据高效多模态大语言模型。我们还发现,对使用不同序列长度训练的检查点权重进行平均特别有效,并且在结合测试时分辨率搜索时能产生进一步的增益。我们的实验展示了卓越的数据效率:MindVL-8B仅使用Qwen2.5VL-7B 10%的训练数据即达到了其性能水平,而我们的MoE模型MindVL-671B-A37B仅使用Qwen2.5VL训练数据的3%即达到了Qwen2.5VL-72B的性能水平,并在性能上与其他领先的多元专家模型相当。我们的工作为社区提供了一个有价值的硬件替代方案、开放的数据方案以及有效的性能增强技术。

关键词

引用

@article{arxiv.2509.11662,
  title  = {MindVL: Towards Efficient and Effective Training of Multimodal Large Language Models on Ascend NPUs},
  author = {Feilong Chen and Yijiang Liu and Yi Huang and Hao Wang and Miren Tian and Ya-Qi Yu and Minghui Liao and Jihao Wu},
  journal= {arXiv preprint arXiv:2509.11662},
  year   = {2025}
}