中文

360DVD:基于360度视频扩散模型的可控全景视频生成

计算机视觉与模式识别 2024-05-13 v2

摘要

全景视频因其沉浸式体验,近年来在研究和应用领域引起了更多关注。由于捕获360度全景视频成本高昂,通过提示词生成理想的全景视频成为迫切需求。近期涌现的文本到视频(T2V)扩散方法在标准视频生成中展现出显著效果。然而,由于全景视频与标准视频在内容和运动模式上存在显著差异,这些方法在生成令人满意的360度全景视频时面临挑战。本文提出了一种名为360度视频扩散模型(360DVD)的流程,用于基于给定提示词和运动条件生成360度全景视频。具体而言,我们引入了一个轻量级的360适配器,并辅以360增强技术,将预训练的T2V模型转化为全景视频生成模型。我们进一步提出了一个名为WEB360的新全景数据集,包含全景视频-文本对,用于训练360DVD,以解决带字幕全景视频数据集缺失的问题。大量实验证明了360DVD在全景视频生成方面的优越性和有效性。我们的项目页面位于 https://akaneqwq.github.io/360DVD/。

关键词

引用

@article{arxiv.2401.06578,
  title  = {360DVD: Controllable Panorama Video Generation with 360-Degree Video Diffusion Model},
  author = {Qian Wang and Weiqi Li and Chong Mou and Xinhua Cheng and Jian Zhang},
  journal= {arXiv preprint arXiv:2401.06578},
  year   = {2024}
}

备注

arXiv admin note: text overlap with arXiv:2307.04725 by other authors