中文

长视频叙事生成综述:架构、一致性与电影质量

计算机视觉与模式识别 2025-07-11 v1

摘要

尽管视频生成模型已取得显著进展,现有 SOTA 方法仅能生成持续 5-16 秒的视频,常被称为“长视频”。超过 16 秒的视频在叙事中难以维持角色外观和场景布局的一致性。特别是,多主体长视频仍无法保持角色一致性和运动连贯性。虽然某些方法可生成最长达 150 秒的视频,但常 suffer 从帧冗余和低时序多样性。近期工作尝试生成具有多个角色、叙事连贯性和高保真细节的长视频。我们综合研究了 32 篇关于视频生成的论文,识别出持续这些特征的关键架构组件和训练策略。我们还构建了全新的方法分类框架,呈现比较表格,对按架构设计和性能特征分类的论文进行了梳理。

关键词

引用

@article{arxiv.2507.07202,
  title  = {A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality},
  author = {Mohamed Elmoghany and Ryan Rossi and Seunghyun Yoon and Subhojyoti Mukherjee and Eslam Bakr and Puneet Mathur and Gang Wu and Viet Dac Lai and Nedim Lipka and Ruiyi Zhang and Varun Manjunatha and Chien Nguyen and Daksh Dangi and Abel Salinas and Mohammad Taesiri and Hongjie Chen and Xiaolei Huang and Joe Barrow and Nesreen Ahmed and Hoda Eldardiry and Namyong Park and Yu Wang and Jaemin Cho and Anh Totti Nguyen and Zhengzhong Tu and Thien Nguyen and Dinesh Manocha and Mohamed Elhoseiny and Franck Dernoncourt},
  journal= {arXiv preprint arXiv:2507.07202},
  year   = {2025}
}