中文

扩散模型中的时空控制

计算机视觉与模式识别 2025-04-22 v2

摘要

我们提出 4DiM,一种用于 4D 新视角合成 (NVS) 的级联扩散模型,支持任意相机轨迹和时间戳的生成,适用于自然场景,基于一张或多张图像进行条件化。通过新颖的体系结构和采样程序,我们实现了在混合 3D(带相机姿态)、4D(姿态+时间)和视频(时间但无姿态)数据上的训练,显著提升了对未见图像和相机姿态轨迹的泛化能力,优于专注于有限领域(如以物体为中心)的先前工作。4DiM 是首个实现直观标度相机姿态控制的 NVS 方法,凭借我们新颖的结构从运动- posed 数据校准管道而实现。实验表明,4DiM 在图像保真度和姿态对齐方面均优于先前的 3D NVS 模型,同时实现了场景动态的生成。4DiM 提供了一种通用框架,可用于各种任务,包括单图像到 3D、两图像到视频(插值和外推)以及姿态条件视频到视频转换,我们在各种场景中对其进行了定性展示。概览请参阅 https://4d-diffusion.github.io

关键词

引用

@article{arxiv.2407.07860,
  title  = {Controlling Space and Time with Diffusion Models},
  author = {Daniel Watson and Saurabh Saxena and Lala Li and Andrea Tagliasacchi and David J. Fleet},
  journal= {arXiv preprint arXiv:2407.07860},
  year   = {2025}
}

备注

ICLR 2025, First three authors contributed equally