中文

Dreamitate:基于视频生成的现实 visuomotor 策略学习

机器人学 2024-06-25 v1 计算机视觉与模式识别

摘要

操控的关键挑战在于学习一种能够对 diverse 视觉环境实现稳健泛化的策略。利用预训练于大规模互联网视频数据集的视频生成模型以学习稳健策略是一个可行的方案。本文提出一种visuomotor策略学习框架,通过在给定任务的人类演示上微调视频扩散模型。在测试阶段,我们生成一个以 novel scene 图像为条件的任务执行示例,并直接将此合成的执行用于控制机器人。我们的关键洞见在于,通过使用 common tools,我们能够轻松地弥合人类手和机器人操作机械臂之间的 embodiment gap。我们在四个复杂度递增的任务上进行评估,证明了利用互联网规模的生成模型允许所学策略比现有行为模仿方法实现显著更高的泛化程度。

关键词

引用

@article{arxiv.2406.16862,
  title  = {Dreamitate: Real-World Visuomotor Policy Learning via Video Generation},
  author = {Junbang Liang and Ruoshi Liu and Ege Ozguroglu and Sruthi Sudhakar and Achal Dave and Pavel Tokmakov and Shuran Song and Carl Vondrick},
  journal= {arXiv preprint arXiv:2406.16862},
  year   = {2024}
}

备注

Project page: https://dreamitate.cs.columbia.edu/