ORV:以4D占用为中心的机器人视频生成
计算机视觉与模式识别
2025-11-24 v2
摘要
近期的具身智能面临数据稀缺问题,而传统模拟器缺乏视觉真实感。可控视频生成正成为一种有前景的数据引擎,然而当前基于动作的方法仍然存在不足:生成的视频在保真度和时间一致性上受限,与控制对齐不佳,且通常局限于单视角设定。我们将这些问题归因于稀疏控制输入与稠密像素输出之间的表示鸿沟。因此,我们提出了ORV,一种以4D占用为中心的机器人视频生成框架,将动作先验与源自占用的视觉先验相耦合。具体而言,我们通过Action-Expert AdaLN调制将分块的7自由度动作与视频潜空间对齐,并将4D语义占用的2D渲染作为软引导注入生成过程。同时,一个核心障碍是缺乏具身场景的占用数据;因此,我们精心构建了ORV-Data,一个大规模、高质量的机器人操作4D语义占用数据集。在BridgeV2、DROID和RT-1上,ORV提升了视频生成质量和可控性,与SOTA相比FVD降低了18.8%,视觉规划成功率提升3.5%,策略学习成功率提升6.4%。除单视角生成外,ORV原生支持多视角一致合成,并尽管存在显著的域差距,仍能实现从仿真到现实的迁移。代码、模型和数据位于:https://orangesodahub.github.io/ORV
引用
@article{arxiv.2506.03079,
title = {ORV: 4D Occupancy-centric Robot Video Generation},
author = {Xiuyu Yang and Bohan Li and Shaocong Xu and Nan Wang and Chongjie Ye and Zhaoxi Chen and Minghan Qin and Yikang Ding and Zheng Zhu and Xin Jin and Hang Zhao and Hao Zhao},
journal= {arXiv preprint arXiv:2506.03079},
year = {2025}
}
备注
Project page: https://orangesodahub.github.io/ORV/ ; Code: https://github.com/OrangeSodahub/ORV