DreamGen:通过视频世界模型解锁机器人学习中的泛化能力
机器人学
2025-06-19 v2 人工智能
机器学习
摘要
我们介绍 DreamGen,这是一个简单且高效的 4 阶段管线,用于训练能够在行为和环境之间实现泛化的机器人策略,通过神经轨迹——即来自视频世界模型生成的合成机器人数据。DreamGen 利用最先进的图像到视频生成模型,适配目标机器人 embodiment,以产生多样化环境中熟悉或新任务的照片级合成视频。由于这些模型仅生成视频,我们通过潜在动作模型或逆动力学模型(IDM)恢复伪动作序列。尽管方法简单,DreamGen 仍实现了强大的行为和环境泛化:人oid 机器人能够在看见和未看见的环境中执行 22 项新行为,仅需一个环境中单个抓取-放置任务的遥操作数据。为系统评估该管线,我们引入 DreamGen Bench—a 个视频生成基准,显示基准性能与下游策略成功率之间存在强相关性。我们的工作建立了机器人学习规模化的有前景的新方向,超越手动数据收集。代码地址:https://github.com/NVIDIA/GR00T-Dreams
引用
@article{arxiv.2505.12705,
title = {DreamGen: Unlocking Generalization in Robot Learning through Video World Models},
author = {Joel Jang and Seonghyeon Ye and Zongyu Lin and Jiannan Xiang and Johan Bjorck and Yu Fang and Fengyuan Hu and Spencer Huang and Kaushil Kundalia and Yen-Chen Lin and Loic Magne and Ajay Mandlekar and Avnish Narayan and You Liang Tan and Guanzhi Wang and Jing Wang and Qi Wang and Yinzhen Xu and Xiaohui Zeng and Kaiyuan Zheng and Ruijie Zheng and Ming-Yu Liu and Luke Zettlemoyer and Dieter Fox and Jan Kautz and Scott Reed and Yuke Zhu and Linxi Fan},
journal= {arXiv preprint arXiv:2505.12705},
year = {2025}
}
备注
See website for videos: https://research.nvidia.com/labs/gear/dreamgen