中文

Scene-R1:基于视频的大语言模型在无 3D 标注下的 3D 场景推理

计算机视觉与模式识别 2025-06-24 v1

摘要

目前,利用大语言模型 (LLM) 来理解 3D 世界正变得流行。然而,现有的 3D 感知 LLM 充当黑盒:它们输出边界框或文本答案而不揭示这些决策是如何做出的,并且它们仍然依赖预训练的 3D 检测器来提供目标候选框。我们引入了 Scene-R1,这是一个基于视频的框架,通过将强化学习驱动的推理与两阶段定位流水线相结合,学习在没有任何逐点 3D 实例监督的情况下对 3D 场景进行推理。在时间定位阶段,我们明确对视频进行推理,并选择与开放式查询最相关的视频片段。在随后的图像定位阶段,我们分析图像并预测 2D 边界框。之后,我们使用 SAM2 跟踪目标以在 RGB 帧中生成像素精确的掩码,并将它们投影回 3D,从而消除了对基于 3D 检测器的候选框的需求,同时捕获了精细的几何和材质线索。Scene-R1 还可以适应 3D 视觉问答任务,直接从视频回答自由格式的问题。我们的训练流水线只需要任务级的 2D 框或文本标签,而不需要密集的 3D 逐点标签。Scene-R1 在多个数据集上超越了现有的开放词汇基线,同时提供透明、逐步的推理依据。这些结果表明,基于强化学习的推理结合纯 RGB-D 视频,为可信赖的 3D 场景理解提供了一条实用且标注高效的途径。

关键词

引用

@article{arxiv.2506.17545,
  title  = {Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations},
  author = {Zhihao Yuan and Shuyi Jiang and Chun-Mei Feng and Yaolun Zhang and Shuguang Cui and Zhen Li and Na Zhao},
  journal= {arXiv preprint arXiv:2506.17545},
  year   = {2025}
}