Dream2Flow:用三维物体流桥接视频生成与开放世界操作
机器人学
2026-01-01 v1 人工智能
计算机视觉与模式识别
摘要
生成式视频建模已成为一种引人注目的工具,用于零样本推理开放世界操作中合理的物理交互。然而,将此类人类引导的运动转化为机器人系统所需的低级动作仍然是一个挑战。我们观察到,给定初始图像和任务指令,这些模型擅长合成合理的物体运动。因此,我们引入了 Dream2Flow,这是一个通过三维物体流作为中间表示来桥接视频生成与机器人控制的框架。我们的方法从生成视频中重建三维物体运动,并将操作任务形式化为物体轨迹跟踪。通过将状态变化与实现这些变化的执行器分离,Dream2Flow 克服了具身差距,并实现了从预训练视频模型到操作多种类别物体(包括刚体、关节体、可变形体和颗粒体)的零样本引导。通过轨迹优化或强化学习,Dream2Flow 将重建的三维物体流转换为可执行的低级命令,无需特定任务的演示。仿真和真实世界实验凸显了三维物体流作为一个通用且可扩展的接口,用于将视频生成模型适应于开放世界机器人操作。视频和可视化结果可在 https://dream2flow.github.io/ 获取。
引用
@article{arxiv.2512.24766,
title = {Dream2Flow: Bridging Video Generation and Open-World Manipulation with 3D Object Flow},
author = {Karthik Dharmarajan and Wenlong Huang and Jiajun Wu and Li Fei-Fei and Ruohan Zhang},
journal= {arXiv preprint arXiv:2512.24766},
year = {2026}
}
备注
Project website: https://dream2flow.github.io/