中文

StableWorld:迈向稳定且一致的交互式长视频生成

计算机视觉与模式识别 2026-01-22 v1

摘要

在本文中,我们探讨了交互式视频生成中被忽视的稳定性和时间一致性问题,该任务通过摄像机运动和文本提示等交互行为来合成动态且可控的视频世界。尽管世界建模取得了显著进展,但当前方法仍存在严重的不稳定性和时间退化问题,在长时间交互中常导致空间漂移和场景崩溃。为了更好地理解这一问题,我们首先调查了不稳定性的根本原因,并发现误差累积的主要来源在于同一场景,其中生成的帧逐渐偏离初始干净状态并将误差传播到后续帧。基于这一观察,我们提出了一种简单而有效的方法 \textbf{StableWorld},即动态帧驱逐机制。通过持续过滤退化帧并保留几何一致的帧,StableWorld 有效地从源头防止了累积漂移,从而带来更稳定的交互生成及时间一致性。在多个交互式视频模型(例如 Matrix-Game、Open-Oasis 和 Hunyuan-GameCraft)上的优异结果表明,StableWorld 是模型无关的,可应用于不同的交互式视频生成框架,以大幅提升各种交互场景下的稳定性、时间一致性和泛化能力。

关键词

引用

@article{arxiv.2601.15281,
  title  = {StableWorld: Towards Stable and Consistent Long Interactive Video Generation},
  author = {Ying Yang and Zhengyao Lv and Tianlin Pan and Haofan Wang and Binxin Yang and Hubery Yin and Chen Li and Ziwei Liu and Chenyang Si},
  journal= {arXiv preprint arXiv:2601.15281},
  year   = {2026}
}

备注

17 pages, 21 figures,