STAGE: 基于故事板的电影级多镜头叙事生成
计算机视觉与模式识别
2026-03-17 v2
摘要
尽管生成模型在视频合成方面已取得显著的视觉保真度进展,但创建连贯的多镜头叙事仍是一项重大挑战。为解决这一问题,基于关键帧的方法作为计算密集型的端到端方法的有力替代方案出现,提供了细粒度控制和更高效率的优势。然而,这些方法往往无法保持跨镜头一致性,也难以捕捉电影语言。在本文中,我们提出 STAGE(SToryboard-Anchored GEneration 工作流),重新定义了基于关键帧的多镜头视频生成任务。我们不使用稀疏关键帧,而是提出 STEP2 来预测由每个镜头的起止帧对组成的结构化故事板。我们引入多镜头记忆包以确保长程实体一致性,双编码策略以保证镜头内连贯性,以及两阶段训练方案以学习电影级镜头间过渡。我们还贡献了大规模 ConStoryBoard 数据集,包含高质量电影片段以及细粒度的故事进展、电影属性和人类偏好标注。大量实验表明,STAGE 在结构化叙事控制和跨镜头一致性方面取得了优越性能。我们的代码将在此网址公开。
引用
@article{arxiv.2512.12372,
title = {STAGE: Storyboard-Anchored Generation for Cinematic Multi-shot Narrative},
author = {Peixuan Zhang and Zijian Jia and Kaiqi Liu and Shuchen Weng and Si Li and Boxin Shi},
journal= {arXiv preprint arXiv:2512.12372},
year = {2026}
}