3D-R1:增强 3D 视觉语言模型推理能力以实现统一场景理解
计算机视觉与模式识别
2025-08-01 v1
摘要
大型视觉语言模型(VLM)在 2D 视觉理解任务中取得了显著进展,推动了将这些能力扩展到 3D 场景理解的研究。然而,当前的 3D VLM 常因高质量空间数据不足及视点假设的静态特性,难以实现稳健的推理与泛化。为此,我们提出了 3D-R1—a 一种提升 3D VLM 推理能力的基础模型。具体而言,我们首次构建了包含链式思考(CoT)的高质量合成数据集,命名为 Scene-30K,基于 Gemini 2.5 Pro 的数据引擎整合现有 3D-VL 数据集,作为 3D-R1 的冷启动初始化数据。此外,我们引入 RLHF 策略(如 GRPO)增强推理能力,并设计三种奖励函数:感知奖励、语义相似度奖励和格式奖励,以维持检测精度和答案语义准确性。进一步,我们提出动态视角选择策略,自适应选择 3D 场景理解中最具信息性的视角。大量实验表明,3D-R1 在各类 3D 场景基准测试中平均提升 10%,显著增强了 3D 场景理解中的推理与泛化能力。代码:https://github.com/AIGeeksGroup/3D-R1。网站:https://aigeeksgroup.github.io/3D-R1。
引用
@article{arxiv.2507.23478,
title = {3D-R1: Enhancing Reasoning in 3D VLMs for Unified Scene Understanding},
author = {Ting Huang and Zeyu Zhang and Hao Tang},
journal= {arXiv preprint arXiv:2507.23478},
year = {2025}
}