DreamDojo:从大规模人类视频中构建的通用机器人世界模型
机器人学
2026-02-09 v1 人工智能
计算机视觉与模式识别
机器学习
摘要
能够在多种环境中模拟动作结果将彻底变革大规模通用智能体的开发。然而,尤其是针对灵巧机器人任务,对这些世界动态建模面临着显著挑战,主要源于数据覆盖范围有限和稀缺的动作标签。为此,我们介绍 DreamDojo,这是一个基础世界模型,从 44k 小时的第三人称人类视频中学习多样化的交互和灵巧控制。我们的数据混合代表截至目前规模最大的用于世界模型预训练的视频数据集,涵盖广泛的日常场景,包含多样化的物体和技能。为解决动作标签稀缺问题,我们引入连续潜在动作作为统一的代理动作,增强了来自无标签视频的交互知识传递。在针对小规模目标机器人数据进行微调后,DreamDojo 显示出强大的物理理解能力和精确的动作可控性。我们还设计了一个蒸馏管道,将 DreamDojo 加速至 10.81 FPS 的实时速度,并进一步提升上下文一致性。我们的工作使得基于生成式世界模型的多个重要应用成为可能,包括实时遥操作、策略评估和基于模型的规划。在多个具有挑战性的离分布(OOD)基准测试上进行系统评估,验证了我们方法在模拟开放世界、接触丰富任务方面的重要性,为通用机器人世界模型之路打开了大门。
引用
@article{arxiv.2602.06949,
title = {DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos},
author = {Shenyuan Gao and William Liang and Kaiyuan Zheng and Ayaan Malik and Seonghyeon Ye and Sihyun Yu and Wei-Cheng Tseng and Yuzhu Dong and Kaichun Mo and Chen-Hsuan Lin and Qianli Ma and Seungjun Nah and Loic Magne and Jiannan Xiang and Yuqi Xie and Ruijie Zheng and Dantong Niu and You Liang Tan and K. R. Zentner and George Kurian and Suneel Indupuru and Pooya Jannaty and Jinwei Gu and Jun Zhang and Jitendra Malik and Pieter Abbeel and Ming-Yu Liu and Yuke Zhu and Joel Jang and Linxi "Jim" Fan},
journal= {arXiv preprint arXiv:2602.06949},
year = {2026}
}
备注
Project page: https://dreamdojo-world.github.io/