BIVDiff:一种通过桥接图像与视频扩散模型实现通用视频合成的免训练框架
计算机视觉与模式识别
2024-04-10 v2 人工智能
摘要
扩散模型在文本驱动的图像和视频生成方面取得了巨大进展。目前,文本到图像的基础模型被广泛应用于各种下游图像合成任务,如可控图像生成和图像编辑,而下游视频合成任务则因若干原因探索较少。首先,训练视频生成基础模型需要巨大的内存和计算开销。即使有了视频基础模型,下游视频合成任务仍需额外的昂贵训练。其次,尽管一些工作以免训练的方式将图像扩散模型扩展到视频,但时间一致性无法得到很好的保持。最后,这些适配方法通常专为单一任务设计,无法泛化到不同任务。为了缓解这些问题,我们提出了一种免训练的通用视频合成框架,命名为BIVDiff,通过桥接特定的图像扩散模型和通用的文本到视频基础扩散模型来实现。具体来说,我们首先使用特定的图像扩散模型(例如,ControlNet和Instruct Pix2Pix)进行逐帧视频生成,然后对生成的视频执行混合反演,最后将反演得到的潜变量输入到视频扩散模型(例如,VidRD和ZeroScope)中进行时间平滑。这种解耦框架能够为不同目的灵活选择图像模型,具有强大的任务泛化能力和高效率。为了验证BIVDiff的有效性和通用性,我们执行了广泛的视频合成任务,包括可控视频生成、视频编辑、视频修复和视频外扩。
引用
@article{arxiv.2312.02813,
title = {BIVDiff: A Training-Free Framework for General-Purpose Video Synthesis via Bridging Image and Video Diffusion Models},
author = {Fengyuan Shi and Jiaxi Gu and Hang Xu and Songcen Xu and Wei Zhang and Limin Wang},
journal= {arXiv preprint arXiv:2312.02813},
year = {2024}
}
备注
Accepted by CVPR 2024. Project page: https://bivdiff.github.io; GitHub repository: https://github.com/MCG-NJU/BIVDiff