MultiShotMaster: 一个可控的多镜头视频生成框架
计算机视觉与模式识别
2025-12-03 v1
摘要
当前视频生成技术在单镜头片段上表现出色,但在生成具有叙事性的多镜头视频方面存在困难,后者需要灵活的镜头编排、连贯的叙事以及超越文本提示的可控性。为了应对这些挑战,我们提出了 MultiShotMaster,一个高度可控的多镜头视频生成框架。我们通过集成两种新颖的 RoPE 变体来扩展预训练的单镜头模型。首先,我们提出 Multi-Shot Narrative RoPE,它在镜头切换处施加明确的相位偏移,在保留时间叙事顺序的同时实现灵活的镜头编排。其次,我们设计了 Spatiotemporal Position-Aware RoPE,以整合参考令牌和定位信号,实现时空感知的参考注入。此外,为克服数据稀缺问题,我们建立了一个自动化的数据标注流水线,用于提取多镜头视频、字幕、跨镜头定位信号和参考图像。我们的框架利用内在架构特性来支持多镜头视频生成,具备文本驱动的镜头间一致性、带有运动控制的定制化主体以及背景驱动的定制化场景。镜头数量和时长均可灵活配置。大量实验证明了我们框架的优越性能和出色的可控性。
引用
@article{arxiv.2512.03041,
title = {MultiShotMaster: A Controllable Multi-Shot Video Generation Framework},
author = {Qinghe Wang and Xiaoyu Shi and Baolu Li and Weikang Bian and Quande Liu and Huchuan Lu and Xintao Wang and Pengfei Wan and Kun Gai and Xu Jia},
journal= {arXiv preprint arXiv:2512.03041},
year = {2025}
}
备注
Project Page: https://qinghew.github.io/MultiShotMaster