中文

OThink-MR1:通过动态强化学习激发多模态泛化推理能力

机器学习 2025-03-31 v2 信息检索

摘要

多模态大语言模型(MLLMs)因其能够处理多样化输入数据类型并在各种应用中生成连贯且与上下文相关的输出而备受关注。虽然监督微调(SFT)一直是增强 MLLM 在特定任务优化中能力的主要方法,但它在培养关键的泛化推理能力方面往往存在不足。尽管强化学习(RL)在克服这些局限性方面具有巨大潜力,但它遇到了两个重大挑战:(1) 其在多模态任务中的泛化能力在很大程度上仍未被探索;(2) 其训练约束,包括恒定的 Kullback-Leibler 散度或截断策略,往往导致次优瓶颈。为了应对这些挑战,我们提出了 OThink-MR1,这是一种配备了跨多模态任务深刻理解与推理能力的先进 MLLM。具体而言,我们引入了带有动态 Kullback-Leibler 策略的群组相对策略优化(GRPO-D),显著增强了强化学习(RL)性能。对于 Qwen2-VL-2B-Instruct,在两个适配数据集上的同任务评估中,GRPO-D 相比 SFT 实现了超过 5.72% 的相对提升,相比 GRPO 实现了超过 13.59% 的相对提升。此外,GRPO-D 展现出卓越的跨任务泛化能力,在跨任务评估中相比 SFT 平均相对提升超过 61.63%。这些结果突出表明,在一个多模态任务上用 GRPO-D 训练的 MLLM 可以有效地迁移到另一个任务,强调了我们所提出的 OThink-MR1 模型卓越的泛化推理能力。

关键词

引用

@article{arxiv.2503.16081,
  title  = {OThink-MR1: Stimulating multimodal generalized reasoning capabilities via dynamic reinforcement learning},
  author = {Zhiyuan Liu and Yuting Zhang and Feng Liu and Changwang Zhang and Ying Sun and Jun Wang},
  journal= {arXiv preprint arXiv:2503.16081},
  year   = {2025}
}