中文

VD3D: 控制大型视频扩散变换器的 3D 相机控制

计算机视觉与模式识别 2025-03-25 v3

摘要

现代文本到视频合成模型能够从文本描述生成连贯、逼真的复杂视频。然而,大多数现有模型缺乏对相机运动的细粒度控制,这对于内容创建、视觉特效和3D视觉等下游应用至关重要。最近的新方法表明能够生成具有可控相机姿态的视频,这些技术利用基于预训练U-Net的扩散模型,显式地分离空间和时间生成。然而,目前尚无方法能够为处理空间和时间信息联合的基于变换器的视频扩散模型提供相机控制。本文提出一种类似ControlNet的条件机制,用于基于Pl"ucker坐标的时空相机嵌入来驯服视频变换器以实现 3D 相机控制。该方法在RealEstate10K数据集上进行微调后,显示出可控视频生成的最佳性能。迄今为止,我们的工作是首次为基于变换器的视频扩散模型启用相机控制。

关键词

引用

@article{arxiv.2407.12781,
  title  = {VD3D: Taming Large Video Diffusion Transformers for 3D Camera Control},
  author = {Sherwin Bahmani and Ivan Skorokhodov and Aliaksandr Siarohin and Willi Menapace and Guocheng Qian and Michael Vasilkovsky and Hsin-Ying Lee and Chaoyang Wang and Jiaxu Zou and Andrea Tagliasacchi and David B. Lindell and Sergey Tulyakov},
  journal= {arXiv preprint arXiv:2407.12781},
  year   = {2025}
}

备注

ICLR 2025; Project Page: https://snap-research.github.io/vd3d/