中文

EasyControl:将ControlNet迁移到视频扩散生成可控生成与插值

计算机视觉与模式识别 2024-09-17 v2

摘要

跟随以Stable Diffusion为代表的文本导向图像生成技术的发展,视频生成正受到学术界的广泛关注。然而,仅依赖文本指导进行视频生成存在严重局限,因为视频的内容远比图像丰富,尤其是在运动方面,这些信息几乎无法通过纯文本充分描述。幸运的是,在计算机视觉中,各种视觉表征可以作为额外的控制信号来引导生成。有了这些信号,视频生成可以更细致地受控,从而为不同应用提供更大的灵活性。然而,整合各种控制信号并非易事。本文提出一种通用框架EasyControl。通过通过条件适配器传播和注入条件特征,我们的方法使用户能够使用单个条件图控制视频生成。借助该框架,可以将各种条件(包括原始像素、深度、HED等)集成到基于Unet的预训练视频扩散模型中,成本低廉。我们在公开数据集上进行了全面实验,定性和定量结果表明我们的方法在性能上优于最先进的方法。EasyControl在多个验证数据集上显著优于前作,提升了各种评估指标。具体而言,对于草图到视频生成任务,EasyControl在UCF101数据集上相较于VideoComposer实现了152.0的FVD提升和19.9的IS提升。对于保真度,我们的模型展示了强大的图像保留能力,在UCF101和MSR-VTT数据集上实现了高FVD和IS分数,优于其他图像到视频模型。

关键词

引用

@article{arxiv.2408.13005,
  title  = {EasyControl: Transfer ControlNet to Video Diffusion for Controllable Generation and Interpolation},
  author = {Cong Wang and Jiaxi Gu and Panwen Hu and Haoyu Zhao and Yuanfan Guo and Jianhua Han and Hang Xu and Xiaodan Liang},
  journal= {arXiv preprint arXiv:2408.13005},
  year   = {2024}
}