中文

OKAMI:通过单视频模仿教授人形机器人操作技能

机器人学 2024-10-16 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

我们研究了通过单视频模仿教授人形机器人操作技能的问题。我们提出了OKAMI方法,该方法从单个RGB-D视频中生成操作计划,并推导出执行策略。我们方法的核心是对象感知式重定向技术,使人形机器人能够在部署时根据不同物体位置调整,从而模仿RGB-D视频中的人体动作。OKAMI利用开放世界视觉模型识别任务相关物体,并分别对身体动作和手部姿态进行重定向。我们的实验表明,OKAMI在不同视觉和空间条件下均能实现强大的泛化能力,在从观察中进行开放世界模仿方面超越了最先进的基线方法。此外,OKAMI生成的滚动轨迹被用于训练闭环视觉-运动策略,实现了平均79.2%的成功率,无需耗时的遥操作。更多视频请访问我们的网站 https://ut-austin-rpl.github.io/OKAMI/。

关键词

引用

@article{arxiv.2410.11792,
  title  = {OKAMI: Teaching Humanoid Robots Manipulation Skills through Single Video Imitation},
  author = {Jinhan Li and Yifeng Zhu and Yuqi Xie and Zhenyu Jiang and Mingyo Seo and Georgios Pavlakos and Yuke Zhu},
  journal= {arXiv preprint arXiv:2410.11792},
  year   = {2024}
}

备注

Accepted for oral presentation at 8th Annual Conference on Robot Learning. Project website: https://ut-austin-rpl.github.io/OKAMI/