中文

ShotVerse:面向文本驱动多镜头视频创建的电影级摄像控制突破

计算机视觉与模式识别 2026-03-13 v1

摘要

文本驱动视频生成已 democratized 电影创作,但在电影化多镜头场景下的摄像控制仍是一个重要瓶颈。隐式文本提示缺乏精度,而显式轨迹条件则带来巨大的手动开销,且常在当前模型中引发执行失败。为克服这一瓶颈,我们提出一种数据中心的方法范式,认为对齐 (Caption, Trajectory, Video) 三元组构成的内在联合分布可连接自动化剧本编写与精确执行。基于这一洞见,我们提出 ShotVerse,一个“Plan-then-Control”框架,将生成分解为两个协作智能体:基于 VLM 的 Planner 利用空间先验从文本中获取电影化、全局对齐的轨迹,Controller 通过摄像机适配器将这些轨迹渲染为多镜头视频内容。我们方法的核心是构建数据基础:我们设计了一个自动化的多镜头摄像标定管道,将离散的单镜头轨迹对齐到统一的全局坐标系。这有助于 curated ShotVerse-Bench,一个高保真电影数据集,配备三个轨道的评估协议,为我们的框架提供基础。大量实验表明,ShotVerse 有效地弥合了不可靠文本控制与 Labor-intensive 手动绘图之间的差距,实现了卓越的电影美学,生成的多镜头视频既摄像精准又跨镜头一致。

关键词

引用

@article{arxiv.2603.11421,
  title  = {ShotVerse: Advancing Cinematic Camera Control for Text-Driven Multi-Shot Video Creation},
  author = {Songlin Yang and Zhe Wang and Xuyi Yang and Songchun Zhang and Xianghao Kong and Taiyi Wu and Xiaotong Zhao and Ran Zhang and Alan Zhao and Anyi Rao},
  journal= {arXiv preprint arXiv:2603.11421},
  year   = {2026}
}