中文

FloVD: 光流结合视频扩散模型实现增强的相机可控视频合成

计算机视觉与模式识别 2025-03-26 v2

摘要

我们提出 FloVD,一种用于相机可控视频生成的新型视频扩散模型。FloVD 利用光流来表示相机和运动物体的运动。这种方法有两个关键优势。由于光流可以直接从视频中估计,我们的方法允许使用任意训练视频而无需真实相机参数。此外,由于背景光流编码了不同视角之间的三维关联,我们的方法通过利用背景运动实现了精细的相机控制。为了在支持精细相机控制的同时合成自然的物体运动,我们的框架采用了由光流生成和流条件视频合成组成的两阶段视频合成流水线。大量实验证明了我们的方法在精确相机控制和自然物体运动合成方面优于先前方法。

关键词

引用

@article{arxiv.2502.08244,
  title  = {FloVD: Optical Flow Meets Video Diffusion Model for Enhanced Camera-Controlled Video Synthesis},
  author = {Wonjoon Jin and Qi Dai and Chong Luo and Seung-Hwan Baek and Sunghyun Cho},
  journal= {arXiv preprint arXiv:2502.08244},
  year   = {2025}
}

备注

Our paper has been accepted to CVPR 2025. Website: https://jinwonjoon.github.io/flovd_site/ Code: https://github.com/JinWonjoon/FloVD