V-Dreamer: 通过视频生成先验自动化机器人仿真与轨迹合成
机器人学
2026-03-20 v1
摘要
训练通用机器人需要大规模、多样化的操纵数据,但实际收集昂贵且现有仿真器常受限于固定资产库和手动启发式方法。为填补这一差距,我们提出 V-Dreamer,一个完全自动化的框架,可直接从自然语言指令生成开放词汇、仿真就绪的操纵环境和可执行专家轨迹。V-Dreamer 采用一种新颖的生成管道,使用大语言模型和 3D 生成模型构建具有几何约束的物理 grounded 3D 场景,以确保稳定、无碰撞的布局。关键的是,对于行为合成,我们利用视频生成模型作为丰富的运动先验。这些视觉预测随后通过 robust Sim-to-Gen 视觉-动力学对齐模块(利用 CoTracker3 和 VGGT)映射到可执行机器人轨迹。该管道支持高视觉多样性和物理保真度,无需人工干预。为评估生成的数据,我们在包含多样对象和环境变化的合成轨迹上训练 imitation learning 策略。针对使用 Piper 机器人臂进行的桌面操纵任务进行大规模评估,表明我们的策略在仿真中对未知对象的鲁�棒性强,并实现了有效的 sim-to-real 迁移,成功操纵了 novel 真实世界对象。
引用
@article{arxiv.2603.18811,
title = {V-Dreamer: Automating Robotic Simulation and Trajectory Synthesis via Video Generation Priors},
author = {Songjia He and Zixuan Chen and Hongyu Ding and Dian Shao and Jieqi Shi and Chenxu Li and Jing Huo and Yang Gao},
journal= {arXiv preprint arXiv:2603.18811},
year = {2026}
}
备注
8 pages, 6 figures