SpaceR:强化 MLLMs 在视频空间推理能力
摘要
视频空间推理,即从观察到的视频帧推断潜在空间结构,是现有多模态大语言模型(MLLMs)面临的重大挑战。这一限制主要源于 1)缺乏高质量的数据集支持此任务,以及 2)缺乏有效的训练策略来发展空间推理能力。受 RLVR(强化学习可验证奖励)在解锁 LLM 推理能力方面的成功启发,本工作旨在通过 RLVR 框架改进 MLLMs 在视频空间推理方面的能力。为此,我们引入了 框架。首先,我们提出了 数据集,包含 91k 个涵盖多样化空间推理场景的可验证答案问题,以及 60k 个用于维持通用多模态理解的样本。其次,我们提出了 ,这是一种新颖的强化学习方法,将群体相对策略优化(GRPO)扩展引入了 novel map imagination 机制,鼓励模型在思考过程中推断空间布局,从而促进更有效的空间推理。广泛的实验表明,SpaceR 在空间推理基准(如 VSI-Bench、STI-Bench 和 SPAR-Bench)上实现了最先进的性能,同时在视频理解基准(如 Video-MME、TempCompass 和 LongVideoBench)上保持竞争性能。令人惊讶的是,SpaceR 在 VSI-Bench 上的准确率超过 GPT-4o 高出 11.6\%,并与领先的专有模型 Gemini-2.0-Flash 持平,凸显了 SpaceR-151k 数据集和 SG-RLVR 在强化 MLLMs 空间推理能力方面的有效性。代码、模型和数据集均可在 https://github.com/OuyangKun10/SpaceR 获取。
引用
@article{arxiv.2504.01804,
title = {US National Input to the European Strategy Update for Particle Physics},
author = {André de Gouvêa and Hitoshi Murayama and Mark Palmer and Heidi Schellman},
journal= {arXiv preprint arXiv:2504.01804},
year = {2025}
}
备注
Submission to the European Strategy for Particle Physics on behalf of the executive committees of the American Physical Society Divisions for the Physics of Beams and Particles and Fields. There is a supplemental file pointing to other submissions by US groups. arXiv admin note: substantial text overlap with arXiv:2407.19176