中文

RoboDreamer:学习组合世界模型用于机器人想象

机器人学 2024-04-19 v1

摘要

文本到视频模型在机器人决策中显示出巨大潜力,能够想象未来动作的现实计划以及准确的环境模拟。然而,这类模型的一个主要问题是泛化——模型仅限于合成与训练时所见语言指令相似的视频。这在决策中受到很大限制,因为我们希望有一个强大的世界模型来合成未见过的物体和动作组合的计划,以解决新环境中的未见任务。为了解决这个问题,我们引入了RoboDreamer,一种通过分解视频生成来学习组合世界模型的创新方法。我们利用语言的天然组合性将指令解析为一组低级原语,并以此为基础训练一组模型来生成视频。我们说明了这种分解如何自然地实现组合泛化,允许我们将新的自然语言指令表述为先前所见组件的组合。我们进一步展示了这种分解如何使我们能够添加额外的多模态目标,从而允许我们在给定自然语言指令和目标图像的情况下指定要生成的视频。我们的方法能够成功合成RT-X中未见目标的视频计划,实现模拟中的成功机器人执行,并显著优于单一的视频生成基线方法。

关键词

引用

@article{arxiv.2404.12377,
  title  = {RoboDreamer: Learning Compositional World Models for Robot Imagination},
  author = {Siyuan Zhou and Yilun Du and Jiaben Chen and Yandong Li and Dit-Yan Yeung and Chuang Gan},
  journal= {arXiv preprint arXiv:2404.12377},
  year   = {2024}
}