MovieDreamer:用于连贯长时段视觉序列的层次生成
计算机视觉与模式识别
2025-11-26 v3
摘要
最近的视频生成技术进步主要依赖于用于短时段内容的扩散模型。然而,这些方法在建模复杂叙事和维持字符在延长时间段内的一致性方面往往不足,这对于像电影这样的长篇视频生产至关重要。我们提出 MovieDreamer,一种新型的层次框架,将自回归模型和基于扩散的渲染优势相结合,以开创性地实现具有复杂情节进展和高视觉保真度的长时段视频生成。我们的方法利用自回归模型实现全局叙事连贯性,预测一系列视觉标记,然后通过扩散渲染转化为高质量视频帧。这种方法类似于传统电影制作过程,其中复杂故事被分解为可管理的场景捕获。进一步,我们采用多模态脚本丰富场景描述,加入详细的字符信息和视觉风格,从而增强跨场景的连续性和字符身份。我们在各种电影类型上进行了广泛实验,表明我们的做法不仅在视觉和叙事质量方面取得优越性能,而且有效地显著延长了生成内容的时长,远超当前能力。主页:https://aim-uofa.github.io/MovieDreamer/。
引用
@article{arxiv.2407.16655,
title = {MovieDreamer: Hierarchical Generation for Coherent Long Visual Sequence},
author = {Canyu Zhao and Mingyu Liu and Wen Wang and Weihua Chen and Fan Wang and Hao Chen and Bo Zhang and Chunhua Shen},
journal= {arXiv preprint arXiv:2407.16655},
year = {2025}
}
备注
30 pages, 22 figures