中文

Metis-RISE:强化学习激励与监督微调增强多模态推理模型学习

人工智能 2025-06-27 v2 计算机视觉与模式识别 机器学习

摘要

近期大语言模型(LLM)的发展见证了高级推理范式的激增,这些范式现在正被整合到多模态大语言模型(MLLM)中。然而,现有方法往往存在不足:仅使用强化学习(RL)的方法可能面临样本效率低下和激活完全缺失的推理能力的问题,而以冷启动监督微调(SFT)阶段开始再进行 RL 的传统流水线可能会限制模型的探索能力并面临次优收敛。在这项工作中,我们提出了 Metis-RISE(强化学习激励与监督微调增强),用于多模态推理模型学习。与传统方法不同,Metis-RISE 独特地省略了初始 SFT 阶段,而是从 RL 阶段开始(例如使用 Group Relative Policy Optimization 变体)来激励和激活模型潜在的推理能力。随后,目标的 SFT 阶段解决 RL 期间识别的两个关键挑战:(1)对于模型具备但不一致应用正确推理的任务,存在低效轨迹采样问题,我们通过使用 RL 模型自身的自蒸馏推理轨迹来解决;(2)基本能力缺失,我们通过为模型完全失败的提示注入专家增强知识来解决。这种先 RL 激励后 SFT 增强的策略应用构成了 Metis-RISE 的核心,产生了我们 MLLM 的两个版本(7B 和 72B 参数)。OpenCompass 多模态推理排行榜上的评估表明,两个模型在同等规模模型中均达到最先进性能,72B 版本总体排名第四。请访问我们的项目页面获取开源信息。

关键词

引用

@article{arxiv.2506.13056,
  title  = {Metis-RISE: RL Incentivizes and SFT Enhances Multimodal Reasoning Model Learning},
  author = {Haibo Qiu and Xiaohan Lan and Fanfan Liu and Xiaohu Sun and Delian Ruan and Peng Shi and Lin Ma},
  journal= {arXiv preprint arXiv:2506.13056},
  year   = {2025}
}

备注

Project Page: https://github.com/MM-Thinking/Metis-RISE