中文

Gen2Act:新场景下的人类视频生成赋能可泛化机器人操作

机器人学 2024-09-25 v1 计算机视觉与模式识别 机器学习 图像与视频处理

摘要

机器人操作策略如何泛化到涉及未见物体类型和新运动的新任务?在本文中,我们提供了一种解决方案,即通过人类视频生成从网络数据中预测运动信息,并以生成的视频作为机器人策略的条件。我们没有尝试扩展昂贵的机器人数据收集,而是展示了如何利用在易于获取的网络数据上训练的视频生成模型来实现泛化。我们的方法Gen2Act将语言条件操作转化为零样本人类视频生成,随后由以生成视频为条件的单一策略执行操作。为了训练该策略,我们使用的机器人交互数据量比视频预测模型的训练数据量少一个数量级。Gen2Act完全不需要微调视频模型,我们直接使用预训练模型来生成人类视频。我们在多样化的真实世界场景中的结果表明,Gen2Act能够操作未见物体类型,并执行机器人数据中不存在的新任务的运动。视频见 https://homangab.github.io/gen2act/

关键词

引用

@article{arxiv.2409.16283,
  title  = {Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation},
  author = {Homanga Bharadhwaj and Debidatta Dwibedi and Abhinav Gupta and Shubham Tulsiani and Carl Doersch and Ted Xiao and Dhruv Shah and Fei Xia and Dorsa Sadigh and Sean Kirmani},
  journal= {arXiv preprint arXiv:2409.16283},
  year   = {2024}
}

备注

Preprint. Under Review