LongVie 2:多模态可控超长视频世界模型
计算机视觉与模式识别
2025-12-16 v1
摘要
在预训练视频生成系统上构建视频世界模型是通用时空智能的一个重要而具挑战性的步骤。世界模型应具备三个基本属性:可控性、长期视觉质量和时间一致性。为此,我们采用渐进式方法,首先增强可控性,再拓展至长期高质量生成。我们提出了 LongVie 2,一个在三个阶段中完成训练的端到端自回归框架:(1)多模态引导,将稠密和稀疏控制信号整合,提供隐式的世界级监督并提高可控性;(2)针对输入帧的退化感知训练,弥合训练与长期推理之间的差距,以保持高视觉质量;(3)历史上下文引导,将相邻片段之间的上下文信息对齐,以确保时间一致性。我们进一步引入了 LongVGenBench,一个包含 100 个高分辨率一分钟视频的综合基准,涵盖多样化的真实世界和合成环境。大量实验表明,LongVie 2 在长程可控性、时间连贯性和视觉保真度方面实现了最新进展,支持持续生成最长达五分钟的视频,标志着通用视频世界建模的重要一步。
引用
@article{arxiv.2512.13604,
title = {LongVie 2: Multimodal Controllable Ultra-Long Video World Model},
author = {Jianxiong Gao and Zhaoxi Chen and Xian Liu and Junhao Zhuang and Chengming Xu and Jianfeng Feng and Yu Qiao and Yanwei Fu and Chenyang Si and Ziwei Liu},
journal= {arXiv preprint arXiv:2512.13604},
year = {2025}
}
备注
Project Page: https://vchitect.github.io/LongVie2-project/