CamCtrl3D:通过精确3D相机控制进行单图像场景探索
计算机视觉与模式识别
2025-02-03 v2
摘要
我们提出了一种方法,从单张图像和给定的相机轨迹生成场景的飞越视频。我们基于图像到视频的潜在扩散模型。我们使用四种技术将相机轨迹作为UNet去噪器的条件。(1) 我们将UNet的时间块条件设置为原始相机外参,类似于MotionCtrl。(2) 我们使用包含相机光线和方向的图像,类似于CameraCtrl。(3) 我们将初始图像重投影到后续帧,并将生成的视频作为条件。(4) 我们使用2D<=>3D变换器引入全局3D表示,隐式地以相机姿态为条件。我们将所有条件组合在ControlNet风格的架构中。然后我们提出一个度量标准,评估整体视频质量和随视角变化保留细节的能力,用于分析单个和组合条件的权衡。最后,我们确定了条件的最优组合。我们在数据集中校准相机位置以实现跨场景的尺度一致性,并训练了场景探索模型CamCtrl3D,展示了最先进的结果。
引用
@article{arxiv.2501.06006,
title = {CamCtrl3D: Single-Image Scene Exploration with Precise 3D Camera Control},
author = {Stefan Popov and Amit Raj and Michael Krainin and Yuanzhen Li and William T. Freeman and Michael Rubinstein},
journal= {arXiv preprint arXiv:2501.06006},
year = {2025}
}
备注
To be published in 3DV 2025. Project page at https://camctrl3d.github.io