中文

RoboCLIP:单次演示即可学习机器人策略

人工智能 2023-10-13 v1 机器人学

摘要

奖励设定是强化学习中一个众所周知的难题,需要大量专家监督来设计鲁棒的奖励函数。模仿学习(IL)方法试图利用专家演示来规避这些问题,但通常要求大量领域内专家演示。受视频-语言模型(VLM)领域进展的启发,我们提出RoboCLIP,一种在线模仿学习方法,它使用单次演示(克服大量数据需求),以视频演示或任务文本描述的形式,在无需手动设计奖励函数的情况下生成奖励。此外,RoboCLIP还可利用域外演示,例如人类解决任务的视频来生成奖励,从而避免了演示域与部署域必须一致的需求。RoboCLIP利用预训练VLM且无需任何微调来生成奖励。使用RoboCLIP奖励训练的强化学习智能体在下游机器人操作任务上实现了比竞争模仿学习方法高2-3倍的零样本性能,且仅使用一段视频/文本演示。

关键词

引用

@article{arxiv.2310.07899,
  title  = {RoboCLIP: One Demonstration is Enough to Learn Robot Policies},
  author = {Sumedh A Sontakke and Jesse Zhang and Sébastien M. R. Arnold and Karl Pertsch and Erdem Bıyık and Dorsa Sadigh and Chelsea Finn and Laurent Itti},
  journal= {arXiv preprint arXiv:2310.07899},
  year   = {2023}
}