中文

DreamVideo:兼具图像保留与文本引导的高保真图像到视频生成

计算机视觉与模式识别 2024-09-17 v4

摘要

图像到视频生成,旨在从给定的参考图像出发生成视频,已引起广泛关注。现有方法试图将预训练的文本引导图像扩散模型扩展为图像引导视频生成模型。然而,由于这些方法在浅层图像引导和时序一致性方面的局限性,其结果往往要么保真度低,要么随时间出现闪烁。为解决这些问题,我们提出了一种高保真图像到视频生成方法,通过在预训练视频扩散模型的基础上设计一个帧保留分支,命名为DreamVideo。我们的DreamVideo并非在语义层面将参考图像融入扩散过程,而是通过卷积层感知参考图像,并将其特征与噪声潜变量拼接作为模型输入。通过这种方式,参考图像的细节能够被最大程度地保留。此外,通过结合双重条件无分类器引导,仅需提供不同的提示文本,即可将单张图像引导至不同动作的视频。这对于可控视频生成具有重要意义,并拥有广阔的应用前景。我们在公开数据集上进行了全面的实验,定量和定性结果均表明,我们的方法优于当前最先进的方法。特别是在保真度方面,我们的模型具有强大的图像保留能力,据我们所知,在UCF101数据集上相比其他图像到视频模型取得了最佳结果。同时,通过给出不同的文本提示可以实现精确控制。更多细节和模型的综合结果将在https://anonymous0769.github.io/DreamVideo/ 上展示。

关键词

引用

@article{arxiv.2312.03018,
  title  = {DreamVideo: High-Fidelity Image-to-Video Generation with Image Retention and Text Guidance},
  author = {Cong Wang and Jiaxi Gu and Panwen Hu and Songcen Xu and Hang Xu and Xiaodan Liang},
  journal= {arXiv preprint arXiv:2312.03018},
  year   = {2024}
}