中文

RewardMap:通过多阶段强化学习解决细粒度视觉推理中的稀疏奖励问题

计算机视觉与模式识别 2026-02-24 v2 人工智能

摘要

细粒度视觉推理仍然是多模态大语言模型(MLLM)的核心挑战。最近引入的 ReasonMap 突显了这一差距,表明即使先进的 MLLM 在结构化和信息丰富的设置(如交通地图)中也难以进行空间推理,这是一项具有明显实际和科学重要性的任务。然而,此类任务上的标准强化学习(RL)受到稀疏奖励和不稳定优化的阻碍。为此,我们首先构建了 ReasonMap-Plus,一个扩展数据集,通过视觉问答(VQA)任务引入密集奖励信号,使细粒度视觉理解技能的有效冷启动训练成为可能。接下来,我们提出 RewardMap,一个多阶段 RL 框架,旨在提升 MLLM 的视觉理解和推理能力。RewardMap 包含两个关键设计。首先,我们引入了一种难度感知奖励设计,纳入细节奖励,直接解决稀疏奖励问题,同时提供更丰富的监督。其次,我们提出了一种多阶段 RL 方案,从简单的感知任务启动训练到复杂的推理任务,提供了一种比传统监督微调(SFT)更有效的冷启动策略。在 ReasonMap 和 ReasonMap-Plus 上的实验表明,RewardMap 的每个组件都贡献了持续的性能提升,而它们的组合产生了最佳结果。此外,使用 RewardMap 训练的模型在涵盖空间推理、细粒度视觉推理和交通地图以外的一般任务的 6 个基准测试上平均提升了 3.47%,凸显了增强的视觉理解和推理能力。

关键词

引用

@article{arxiv.2510.02240,
  title  = {RewardMap: Tackling Sparse Rewards in Fine-grained Visual Reasoning via Multi-Stage Reinforcement Learning},
  author = {Sicheng Feng and Kaiwen Tuo and Song Wang and Lingdong Kong and Jianke Zhu and Huan Wang},
  journal= {arXiv preprint arXiv:2510.02240},
  year   = {2026}
}

备注

ICLR 2026, website: https://fscdc.github.io/RewardMap/