中文

CamCo: 相机可控的3D一致图像到视频生成

计算机视觉与模式识别 2024-06-05 v1

摘要

最近,视频扩散模型已成为面向普通用户的高质量视频内容生成的表达性生成工具。然而,这些模型通常无法精确控制视频生成的相机姿态,限制了电影语言的表达和用户控制。为了解决这个问题,我们引入了CamCo,它允许对图像到视频生成进行细粒度的相机姿态控制。我们使用普吕克坐标为预训练的图像到视频生成器配备精确参数化的相机姿态输入。为了增强生成视频的3D一致性,我们在每个注意力块中集成了一个极线注意力模块,对特征图施加极线约束。此外,我们通过运动恢复结构算法估计相机姿态,在真实世界视频上微调CamCo,以更好地合成物体运动。实验表明,与之前的模型相比,CamCo显著提高了3D一致性和相机控制能力,同时有效生成合理的物体运动。项目页面:https://ir1d.github.io/CamCo/

关键词

引用

@article{arxiv.2406.02509,
  title  = {CamCo: Camera-Controllable 3D-Consistent Image-to-Video Generation},
  author = {Dejia Xu and Weili Nie and Chao Liu and Sifei Liu and Jan Kautz and Zhangyang Wang and Arash Vahdat},
  journal= {arXiv preprint arXiv:2406.02509},
  year   = {2024}
}

备注

Project page: https://ir1d.github.io/CamCo/