中文

EgoMimic:通过以太动作视频扩展模仿学习

机器人学 2024-11-01 v1 计算机视觉与模式识别

摘要

模仿学习所需演示数据的规模和多样性是一个重大挑战。我们提出 EgoMimic,一个全栈框架,通过人类 embodiment 数据( Specifically 以太动作视频配合 3D 手部跟踪)来扩展操作。EgoMimic 通过以下方式实现这一目标:(1) 用于捕获人类 embodiment 数据的系统,采用符合人体工程学的 Project Aria 眼镜;(2) 降低成本的双手操作臂机械臂,以最小化人类数据与机器人数据之间的运动学差距;(3) 跨域数据对齐技术;(4) 同时在人类和机器人数据上进行 co-training 的模仿学习架构。与仅从人类视频中提取高层次意图的先前工作相比,我们的方法将人类和机器人数据视为等价的 embodiment 演示数据,并从两种数据源学习统一策略。EgoMimic 在一系列具有挑战性的单臂和双手操作任务上显著优于最先进的模仿学习方法,并实现对全新场景的泛化。最后,我们展示了 EgoMimic 的良好扩展趋势,其中额外增加 1 小时的手部数据比额外增加 1 小时的机器人数据价值更大。视频和其他信息可在 https://egomimic.github.io/ 查找。

关键词

引用

@article{arxiv.2410.24221,
  title  = {EgoMimic: Scaling Imitation Learning via Egocentric Video},
  author = {Simar Kareer and Dhruv Patel and Ryan Punamiya and Pranay Mathur and Shuo Cheng and Chen Wang and Judy Hoffman and Danfei Xu},
  journal= {arXiv preprint arXiv:2410.24221},
  year   = {2024}
}