中文

通过双向交互式 RL 的工具增强空间推理

计算机视觉与模式识别 2025-12-04 v1 机器人学

摘要

视觉语言模型(VLM)在质性视觉理解方面表现出强大能力,但在需要度量精确空间推理的具身应用中则感到困难。代理范式承诺 VLM 可以使用诸如深度估计器、分割模型和姿态估计器等多种工具来增强这些能力。然而,要实现这一愿景而不仅仅依赖手工制作的提示策略或限制 VLM 发现最优工具使用模式的固定、预定义工具管道,仍是一个开放性挑战。虽然强化学习可以克服这一差距,但迄今为止仅能针对单一视觉工具进行推理,因为多工具推理的搜索空间极大。我们引入双向交互式强化学习(DIRL),一个两阶段训练框架,其中 VLM 通过交互式探索和反馈学习协调多个工具。在教学阶段,我们结合通过交互式 RL 训练的单一工具专家的演示与使用所有工具的前沿模型的轨迹。在探索阶段,模型进一步通过持续的 RL 细化多工具协调。我们开发的模型 SpaceTools 具备工具增强的空间推理能力,在 RoboSpatial-Home、BLINK、BOP-ASK 等空间理解基准测试中实现了最先进的性能,并在使用 7 自由度机器人作为工具进行实际操作中表现出可靠的能力。DIRL 在 vanilla SFT(+12% 在 RoboSpatial)和 RL(+16% 在 RoboSpatial)基准测试中均取得了显著的改进。项目页面: https://spacetools.github.io/。

关键词

引用

@article{arxiv.2512.04069,
  title  = {SpaceTools: Tool-Augmented Spatial Reasoning via Double Interactive RL},
  author = {Siyi Chen and Mikaela Angelina Uy and Chan Hee Song and Faisal Ladhak and Adithyavairavan Murali and Qing Qu and Stan Birchfield and Valts Blukis and Jonathan Tremblay},
  journal= {arXiv preprint arXiv:2512.04069},
  year   = {2025}
}