中文

通过模型合并实现高效多模态统一推理模型

人工智能 2025-11-21 v2

摘要

尽管多模态大语言模型(MLLMs)在多种任务上展现了卓越的能力,但它们在推理效率、模型规模庞大以及过度思考方面仍面临挑战。然而,现有的轻量级 MLLMs 缺乏在小规模下兼顾高效率与高性能的能力。为此,我们提出 Tiny-R1V,一种新颖的 3B 轻量级模型,通过两阶段优化实现更快推理与更高准确率,同时以更少的推理 token 统一跨任务的多模态推理。在第一阶段,Tiny-R1V 引入长度感知相对策略优化(LIPO),一种新的强化学习方法,用于训练每个推理模型,包括数学推理、图表推理和 OCR 能力。LIPO 通过优先选择简洁且高质量的响应,在组内动态调整响应的优势,从而鼓励生成更短且更准确的响应。在第二阶段,我们提出自适应模型合并(AMM),一种无需训练即可将多个专家模型合并为统一架构的模型合并方法。具体而言,AMM 通过一种新颖的梯度投影正则化损失函数自适应调整任务向量的权重,从而缓解它们之间的冗余冲突。在涵盖数学、结构化数据(图表、表格、文档)、OCR 以及通用能力的十个广泛使用的推理基准上的大量评估,展示了 Tiny-R1V 的卓越性能,使轻量级模型能够在多样化的多模态推理任务中表现出色。代码将在 \href{https://github.com/buptyqx/Tiny-R1V}{https://github.com/buptyqx/Tiny-R1V} 提供。

关键词

引用

@article{arxiv.2510.08987,
  title  = {Towards Efficient Multimodal Unified Reasoning Model via Model Merging},
  author = {Qixiang Yin and Huanjin Yao and Jianghao Chen and Jiaxing Huang and Zhicheng Zhao and Fei Su},
  journal= {arXiv preprint arXiv:2510.08987},
  year   = {2025}
}

备注

Technical report, Code will be available at https://github.com/buptyqx/Tiny-R1V