中文

Vivid-ZOO: 基于扩散模型的多视角视频生成

计算机视觉与模式识别 2024-06-14 v1

摘要

尽管扩散模型在2D图像/视频生成方面表现出色,但基于扩散的文本到多视角视频(T2MVid)生成仍未得到充分探索。T2MVid生成带来的新挑战在于缺乏大量带标注的多视角视频以及建模这种多维分布的复杂性。为此,我们提出了一种新颖的基于扩散的流水线,该流水线根据文本生成以动态3D对象为中心的高质量多视角视频。具体来说,我们将T2MVid问题分解为视角空间和时间组件。这种分解使我们能够组合和重用先进的预训练多视角图像和2D视频扩散模型的层,以确保生成的多视角视频的多视角一致性和时间连贯性,从而大大降低训练成本。我们进一步引入对齐模块,以对齐来自预训练多视角和2D视频扩散模型的层的潜在空间,解决由于2D和多视角数据之间的领域差距而产生的重用层不兼容问题。为了支持这项及未来的研究,我们还贡献了一个带标注的多视角视频数据集。实验结果表明,我们的方法能够根据各种文本提示生成高质量的多视角视频,展现出生动的运动、时间连贯性和多视角一致性。

关键词

引用

@article{arxiv.2406.08659,
  title  = {Vivid-ZOO: Multi-View Video Generation with Diffusion Model},
  author = {Bing Li and Cheng Zheng and Wenxuan Zhu and Jinjie Mai and Biao Zhang and Peter Wonka and Bernard Ghanem},
  journal= {arXiv preprint arXiv:2406.08659},
  year   = {2024}
}

备注

Our project page is at https://hi-zhengcheng.github.io/vividzoo/