借助视觉语言模型搭建灵巧操作
机器人学
2026-01-13 v3
摘要
灵巧机器人手掌是执行复杂操作任务的关键,但因演示收集困难和控制维度高,训练仍面临挑战。虽然强化学习(RL)可通过在仿真中生成经验来缓解数据瓶颈,但通常依赖 carefully 设计的、针对特定任务的奖励函数,这会限制其可扩展性和泛化能力。因此,灵巧操作的当代研究往往依赖参考轨迹进行引导。这些轨迹指定手部姿态目标,以指导RL策略的探索,并指定物体姿态,以实现稠密、任务无关的奖励。然而,获取适合的轨迹——尤其是灵巧手部的轨迹——仍是重大挑战。尽管显式参考轨迹中的精确细节在最终RL细化运动时往往不必要。我们的关键洞见是,现代视觉语言模型(VLM)已编码了指定任务、有效引导探索所必需的常识空间和语义知识。给定任务描述(例如“打开橱柜”)和视觉场景,我们的方法使用即插即用的VLM首先识别任务相关关键点(如把手、按钮),随后合成手部运动和物体运动的3D轨迹。随后,我们在仿真中训练低层残差RL策略,以高保真度跟踪这些粗糙的“支架”轨迹。我们在多个涉及关节物体和语义理解的仿真任务中展示了该方法能够学习稳健的灵巧操作策略。此外,我们展示了该方法可无需任何人类演示或手工设计奖励函数即可迁移到真实世界机器人手中。
引用
@article{arxiv.2506.19212,
title = {Scaffolding Dexterous Manipulation with Vision-Language Models},
author = {Vincent de Bakker and Joey Hejna and Tyler Ga Wei Lum and Onur Celik and Aleksandar Taranovic and Denis Blessing and Gerhard Neumann and Jeannette Bohg and Dorsa Sadigh},
journal= {arXiv preprint arXiv:2506.19212},
year = {2026}
}