通过世界模型将生成视频锚定于可行计划
机器学习
2026-03-17 v3
摘要
大规模视频生成模型已展现出零样本视觉规划能力,但生成的视频计划往往违反时间一致性和物理约束,导致实际执行时失败。为此,我们提出了一种基于世界模型的计划方法——将视频计划锚定于可行动作序列(GVP-WM)。在测试阶段,GVP-WM 首先从初始观察和目标观察生成视频计划,然后通过视频引导的潜在位置分离,将视频指导投影到动态可行潜在轨迹的流形上。具体而言,我们将锚定建模为目标条件潜在空间轨迹优化问题,在世界模型动力学下联合优化潜在状态和动作,同时保持与生成视频计划的语义对齐。经验上,GVP-WM 能从零样本生成的图像到视频计划和运动模糊视频中恢复出违反物理约束的可行长程计划,适用于导航和操控仿真任务。
引用
@article{arxiv.2602.01960,
title = {Grounding Generated Videos in Feasible Plans via World Models},
author = {Christos Ziakas and Amir Bar and Alessandra Russo},
journal= {arXiv preprint arXiv:2602.01960},
year = {2026}
}