中文

面向真实世界机器人操作的基于可验证奖励的强化具身规划

机器人学 2025-10-01 v1

摘要

使机器人能够根据自由格式语言指令执行长时程操作任务,仍然是具身智能中的一项基本挑战。尽管视觉语言模型作为高级规划器显示出潜力,但其在真实世界中的部署受到两个差距的阻碍: 缺乏将自然语言与多步动作计划相结合的大规模序列操作数据; 缺乏用于在规划目标上微调 VLM 的密集、可解释奖励。为了解决这些问题,我们提出 REVER,一个使 VLM 能够在真实场景中根据自然语言指令生成并验证长时程操作计划的框架。在 REVER 下,我们训练并发布了 RoboFarseer,这是一个被激励产生思维链以执行时间和空间推理的 VLM,可确保物理上合理且逻辑上连贯的计划。为了获取训练数据,我们利用通用操作接口框架来捕获原子技能的硬件无关演示。自动标注引擎将每次演示转换为视觉-指令-计划三元组。我们引入了一种可验证奖励,通过生成的计划与真实技能序列之间的有序二部匹配重叠度对其进行评分。在运行时,微调后的 VLM 同时充当规划器和监视器,验证逐步完成情况。RoboFarseer 匹配或超越了规模大几个数量级的专有模型,而在开放式规划上,它比最佳基线高出 40% 以上。在真实世界的长时程任务中,与没有规划器的相同低级控制器相比,完整系统将整体成功率提高了约 60%。我们将在发表后开源数据集和训练模型。

关键词

引用

@article{arxiv.2509.25852,
  title  = {Reinforced Embodied Planning with Verifiable Reward for Real-World Robotic Manipulation},
  author = {Zitong Bo and Yue Hu and Jinming Ma and Mingliang Zhou and Junhui Yin and Yachen Kang and Yuqi Liu and Tong Wu and Diyun Xiang and Hao Chen},
  journal= {arXiv preprint arXiv:2509.25852},
  year   = {2025}
}