LIVE:长时程交互式视频世界建模
计算机视觉与模式识别
2026-02-04 v1
摘要
自回归视频世界模型以动作为条件预测未来视觉观察。虽然在短时程上有效,但这些模型常在长时程生成中表现不佳,因为小预测误差会随时间累积。先前方法通过引入预训练教师模型和序列级分布匹配来缓解此问题,这会增加额外计算成本且无法防止训练 horizon 之外的误差传播。在本工作中,我们提出了 LIVE,即一种长时程交互式视频世界建模方法,通过一种新颖的循环一致性目标实现有界误差累积,从而无需基于教师的蒸馏。具体而言,LIVE 首先从 ground-truth 帧进行前向 rollout,然后应用逆生成过程来重建初始状态。随后在重建的终端状态上计算扩散损失,从而对长时程误差传播提供显式约束。此外,我们提供一种统一的视角涵盖不同方法,并引入渐进式训练课程以稳定训练。实验表明,LIVE 在长时程基准测试上实现了最先进的性能,能够生成远超训练 rollout 长度的稳定、高质量视频。
引用
@article{arxiv.2602.03747,
title = {LIVE: Long-horizon Interactive Video World Modeling},
author = {Junchao Huang and Ziyang Ye and Xinting Hu and Tianyu He and Guiyu Zhang and Shaoshuai Shi and Jiang Bian and Li Jiang},
journal= {arXiv preprint arXiv:2602.03747},
year = {2026}
}
备注
18 pages, 22 figures