中文

CineMaster:用于电影级文本到视频生成的3D感知和可控框架

计算机视觉与模式识别 2025-02-13 v1

摘要

本文提出CineMaster,一种用于3D感知和可控文本到视频生成的新框架。我们的目标是让用户能够获得类似专业电影导演的控制能力:在场景中精确放置物体、对物体和摄像机在3D空间中进行灵活操作,以及对渲染帧实现直观的布局控制。为此,CineMaster分为两个阶段。在第一个阶段,我们设计了一个交互式工作流程,允许用户通过在3D空间中放置物体边界框并定义摄像机运动来直观地构建3D感知条件信号。在第二个阶段,这些控制信号——包括渲染深度图、摄像机轨迹和物体类别标签——作为文本到视频扩散模型的引导,以确保生成用户意图的视频内容。此外,为克服现有野外数据集在3D物体运动和摄像机姿态标注方面的不足,我们仔细构建了一个自动化数据标注管道,从大规模视频数据中提取3D边界框和摄像机轨迹。广泛的定性和定量实验表明,CineMaster显著优于现有方法,实现了突出的3D感知文本到视频生成。项目页面:https://cinemaster-dev.github.io/。

关键词

引用

@article{arxiv.2502.08639,
  title  = {CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation},
  author = {Qinghe Wang and Yawen Luo and Xiaoyu Shi and Xu Jia and Huchuan Lu and Tianfan Xue and Xintao Wang and Pengfei Wan and Di Zhang and Kun Gai},
  journal= {arXiv preprint arXiv:2502.08639},
  year   = {2025}
}