中文

协同视频扩散:带相机控制的一致多视频生成

计算机视觉与模式识别 2024-05-28 v1 图形学

摘要

视频生成的研究近期取得了巨大进展,能够从文本提示或图像生成高质量视频。为视频生成过程添加控制是未来的重要目标,近期以相机轨迹为条件控制视频生成模型的方法在此方向上取得了进展。然而,从多个不同相机轨迹生成同一场景的视频仍具挑战。这一多视频生成问题的解决方案可实现具有可编辑相机轨迹的大规模 3D 场景生成等应用。我们引入协同视频扩散(CVD)作为实现这一愿景的重要一步。CVD 框架包含一个新颖的跨视频同步模块,该模块利用对极注意力机制促进由不同相机位姿渲染的同一视频的对应帧之间的一致性。CVD 在最先进的视频生成相机控制模块之上进行训练,如大量实验所示,其生成的由不同相机轨迹渲染的多个视频在一致性上显著优于基线。项目页面:https://collaborativevideodiffusion.github.io/。

关键词

引用

@article{arxiv.2405.17414,
  title  = {Collaborative Video Diffusion: Consistent Multi-video Generation with Camera Control},
  author = {Zhengfei Kuang and Shengqu Cai and Hao He and Yinghao Xu and Hongsheng Li and Leonidas Guibas and Gordon Wetzstein},
  journal= {arXiv preprint arXiv:2405.17414},
  year   = {2024}
}