中文

ControlVideo:免训练的可控文本到视频生成

计算机视觉与模式识别 2023-05-23 v1

摘要

文本驱动的扩散模型在图像生成中解锁了前所未有的能力,而其视频对应模型由于时序建模的过高训练成本仍然落后。除训练负担外,生成的视频还存在外观不一致与结构闪烁问题,尤其在长视频合成中。为应对这些挑战,我们设计了一个名为\textbf{ControlVideo}的\emph{免训练}框架,以实现自然且高效的文本到视频生成。ControlVideo 改编自 ControlNet,利用输入运动序列的粗略结构一致性,并引入三个模块以改进视频生成。首先,为保证帧间外观连贯,ControlVideo 在自注意力模块中加入了充分的跨帧交互。其次,为缓解闪烁效应,其引入了交错帧平滑器,对交替帧进行帧插值。最后,为高效生成长视频,其采用分层采样器,分别合成每个短片段并保持整体一致性。借助这些模块,ControlVideo 在大量运动-提示对上以定量与定性方式优于现有最优方法(SOTA)。值得注意的是,得益于高效设计,它使用一块 NVIDIA 2080Ti 在几分钟内即可生成短视频与长视频。代码见 https://github.com/YBYBZhang/ControlVideo。

关键词

引用

@article{arxiv.2305.13077,
  title  = {ControlVideo: Training-free Controllable Text-to-Video Generation},
  author = {Yabo Zhang and Yuxiang Wei and Dongsheng Jiang and Xiaopeng Zhang and Wangmeng Zuo and Qi Tian},
  journal= {arXiv preprint arXiv:2305.13077},
  year   = {2023}
}

备注

Code is available at https://github.com/YBYBZhang/ControlVideo