中文

下一场景预测:统一视频模型下的时序推理

计算机视觉与模式识别 2025-12-16 v1

摘要

近年来,统一模型在联合理解与生成方面取得了显著进展,推动了视觉生成能力的提升。然而,这些模型聚焦于文本到视频生成等传统任务,使其在统一模型中关于时序推理的潜能仍鲜有被探索。为填补这一空白,本文提出一种新任务——下一场景预测(NSP),以推动统一视频模型向时序与因果推理迈进。不同于文本到视频生成,NSP要求从前瞻上下文中预测合理的未来场景,要求模型具备更深层的理解与推理能力。为解决此任务,本文提出一种统一框架,集成Qwen-VL进行理解、LTX进行合成,通过潜在查询嵌入和连接模块进行桥接。该模型在全新的大规模NSP数据集上进行三阶段训练:文本到视频预训练、监督微调以及基于我们提出的因果一致性奖励的强化学习(通过GRPO)。实验表明,本模型在基准测试中实现了最先进的性能,推动了通用多模态系统对“下一幕是什么”的预测能力。

关键词

引用

@article{arxiv.2512.13015,
  title  = {What Happens Next? Next Scene Prediction with a Unified Video Model},
  author = {Xinjie Li and Zhimin Chen and Rui Zhao and Florian Schiffers and Zhenyu Liao and Vimal Bhat},
  journal= {arXiv preprint arXiv:2512.13015},
  year   = {2025}
}