基于 VLM 生成的迭代关键点奖励的机器人操作实到仿真再实到方法
机器人学
2025-02-19 v2 人工智能
计算机视觉与模式识别
摘要
机器人操作任务在开放式环境中的任务规范化是一项具有挑战性的工作,需要灵活且可适应的目标,以与人类意图保持一致,并能通过迭代反馈不断演化。我们提出了迭代关键点奖励(IKER),一种基于视觉的、使用 Python 编写的奖励函数,作为动态任务规范。我们的框架利用视觉语言模型(VLM)生成和细化这些奖励函数,以实现多步骤操作任务。给定 RGB-D 观测和自由形式的语言指令,我们对场景中的关键点进行采样,并生成基于这些关键点的奖励函数。IKER 依赖于关键点之间的空间关系,借助关于所需行为的常识先验,实现精确的 SE(3) 控制。我们在仿真中重建真实场景,并使用生成的奖励训练强化学习(RL)策略,然后将其部署到真实世界中,形成实到仿真再实到闭环。我们的 метод在包括prehensile 与 non-prehensile 任务在内的多种场景中均展现出显著能力,展示了多步骤任务执行、意外错误恢复以及动态环境中的即时策略调整。结果凸显了 IKER 在通过迭代奖励塑造,使机器人能够在动态环境中执行多步骤任务方面的有效性。
引用
@article{arxiv.2502.08643,
title = {A Real-to-Sim-to-Real Approach to Robotic Manipulation with VLM-Generated Iterative Keypoint Rewards},
author = {Shivansh Patel and Xinchen Yin and Wenlong Huang and Shubham Garg and Hooshang Nayyeri and Li Fei-Fei and Svetlana Lazebnik and Yunzhu Li},
journal= {arXiv preprint arXiv:2502.08643},
year = {2025}
}
备注
ICRA 2025, Project Page: https://iker-robot.github.io/