Observe-R1:基于动态渐进式强化学习解锁多模态大语言模型的推理能力
机器学习
2025-05-20 v1 人工智能
计算机视觉与模式识别
摘要
强化学习(RL)在提升大语言模型(LLM)推理能力方面显示出前景,但将RL应用于多模态数据与格式的具体挑战仍较少探讨。本文提出Observe-R1—a一种旨在增强多模态大语言模型(MLLM)推理能力的新型框架。我们借鉴人类学习进程的思想——从简单到复杂、从易到难,提出了MLLM的渐进式学习范式。为此,我们构建了NeuraLadder数据集,依据数据样本的难度和复杂度进行组织和抽样,以利于RL训练。为解决多模态任务,本文引入一种多模态格式约束,鼓励对图像进行仔细观察,从而提升视觉能力并使响应更清晰、更结构化。此外,我们实施了奖励系统,偏好在长度限制内的简洁、正确答案,同时引入动态权重机制,优先考虑不确定性较大且中等难度的问题,确保更具信息性的样本对训练产生更大影响。我们在20k个NeuraLadder数据集样本上对Qwen2.5-VL-3B和Qwen2.5-VL-7B模型进行实验,结果显示Observe-R1在推理和常规基准测试中均优于一系列更大规模的推理模型,实现了推理链的清晰度和简洁性。消融研究验证了我们策略的有效性,突出了方法的鲁棒性和泛化性。该数据集和代码将在https://github.com/zrguo/Observe-R1发布。
引用
@article{arxiv.2505.12432,
title = {Observe-R1: Unlocking Reasoning Abilities of MLLMs with Dynamic Progressive Reinforcement Learning},
author = {Zirun Guo and Minjie Hong and Tao Jin},
journal= {arXiv preprint arXiv:2505.12432},
year = {2025}
}