中文

RoboEnvision:面向多任务机器人操控的长时程视频生成模型

计算机视觉与模式识别 2025-06-30 v1

摘要

我们聚焦于生成机器人操控任务的长时程视频。文本到视频扩散模型在照片 realism、语言理解和运动生成方面取得了显著进展,但在处理长时程机器人任务方面仍面临挑战。近期工作利用视频扩散模型生成高质量仿真数据和机器人规划的预测滚动,但这些工作预测机器人完成单个任务的短序列,并采用自回归范式扩展至长时程,导致生成视频和执行中的误差累积。为克服这些限制,我们提出了一种无需自回归生成的新型管道,通过三方面贡献实现:1)首先将高层目标分解为更小的原子任务并生成与这些指令对齐的关键帧;第二个扩散模型随后在每对生成的帧之间进行插值,实现长时程视频。2)我们提出一种语义保真注意力模块,以维持关键帧之间的一致性。3)我们设计了一个轻量级策略模型,从生成的视频中回归机器人关节状态。我们的方法在两个基准测试上在视频质量和一致性方面实现了最先进的效果,同时在长时程任务中超越了以前的策略模型。

关键词

引用

@article{arxiv.2506.22007,
  title  = {RoboEnvision: A Long-Horizon Video Generation Model for Multi-Task Robot Manipulation},
  author = {Liudi Yang and Yang Bai and George Eskandar and Fengyi Shen and Mohammad Altillawi and Dong Chen and Soumajit Majumder and Ziyuan Liu and Gitta Kutyniok and Abhinav Valada},
  journal= {arXiv preprint arXiv:2506.22007},
  year   = {2025}
}

备注

8 pages, 6 figures