中文

超越修补:释放3D理解实现精确相机控制视频生成

计算机视觉与模式识别 2026-02-02 v2 图形学

摘要

相机控制已在条件视频生成中得到广泛研究;然而,在忠实保留视频内容的同时精确改变相机轨迹仍然是一项具有挑战性的任务。实现精确相机控制的主流方法是根据目标轨迹扭曲3D表示。然而,这些方法未能充分利用视频扩散模型(VDM)的3D先验,常常陷入“修补陷阱”,导致主体不一致和生成质量下降。为解决此问题,我们提出了DepthDirector,一个具有精确相机可控性的视频重渲染框架。通过利用来自显式3D表示的深度视频作为相机控制引导,我们的方法能够在新的相机轨迹下忠实地再现输入视频的动态场景。具体来说,我们设计了一种视图-内容双流条件机制,将源视频和在目标视角下渲染的扭曲深度序列注入到预训练的视频生成模型中。这种几何引导信号使VDM能够理解相机运动并利用其3D理解能力,从而促进精确的相机控制和一致的内容生成。接下来,我们引入了一个轻量级的基于LoRA的视频扩散适配器来训练我们的框架,完全保留了VDM的知识先验。此外,我们使用Unreal Engine 5构建了一个名为MultiCam-WarpData的大规模多相机同步数据集,包含跨越1000个动态场景的8K视频。大量实验表明,DepthDirector在相机可控性和视觉质量方面均优于现有方法。我们的代码和数据集将公开提供。

关键词

引用

@article{arxiv.2601.10214,
  title  = {Beyond Inpainting: Unleash 3D Understanding for Precise Camera-Controlled Video Generation},
  author = {Dong-Yu Chen and Yixin Guo and Shuojin Yang and Tai-Jiang Mu and Shi-Min Hu},
  journal= {arXiv preprint arXiv:2601.10214},
  year   = {2026}
}

备注

Project page: https://eleanor6725.github.io/DepthDirector/