中文

从日常人类视频中进行检索与执行

机器人学 2025-04-04 v2 机器学习

摘要

我们提出了R+X框架,使机器人能够从长时间段、未标记的、第一人称人类日常任务视频中学习技能。给定来自人类的语言指令后,R+X首先检索包含相关行为的短视频片段,然后通过在此行为上对条件化的基于情境的模仿学习方法(KAT)进行执行来实现技能。通过利用视觉语言模型(VLM)进行检索,R+X无需对视频进行手动标注;通过利用情境学习进行执行,机器人无需在检索到的视频上进行训练期间即可立即执行指令的技能。针对各种日常家庭任务的实验表明,R+X能够将未标记的人类视频成功转化为稳健的机器人技能,且R+X在多个最近的替代方法中表现出优于它们的性能。视频和代码均可在https://www.robot-learning.uk/r-plus-x获取。

关键词

引用

@article{arxiv.2407.12957,
  title  = {R+X: Retrieval and Execution from Everyday Human Videos},
  author = {Georgios Papagiannis and Norman Di Palo and Pietro Vitiello and Edward Johns},
  journal= {arXiv preprint arXiv:2407.12957},
  year   = {2025}
}

备注

Published at the IEEE International Conference on Robotics and Automation (ICRA) 2025