ControlVideo:免训练的可控文本到视频生成
计算机视觉与模式识别
2023-05-23 v1
摘要
文本驱动的扩散模型在图像生成中解锁了前所未有的能力,而其视频对应模型由于时序建模的过高训练成本仍然落后。除训练负担外,生成的视频还存在外观不一致与结构闪烁问题,尤其在长视频合成中。为应对这些挑战,我们设计了一个名为\textbf{ControlVideo}的\emph{免训练}框架,以实现自然且高效的文本到视频生成。ControlVideo 改编自 ControlNet,利用输入运动序列的粗略结构一致性,并引入三个模块以改进视频生成。首先,为保证帧间外观连贯,ControlVideo 在自注意力模块中加入了充分的跨帧交互。其次,为缓解闪烁效应,其引入了交错帧平滑器,对交替帧进行帧插值。最后,为高效生成长视频,其采用分层采样器,分别合成每个短片段并保持整体一致性。借助这些模块,ControlVideo 在大量运动-提示对上以定量与定性方式优于现有最优方法(SOTA)。值得注意的是,得益于高效设计,它使用一块 NVIDIA 2080Ti 在几分钟内即可生成短视频与长视频。代码见 https://github.com/YBYBZhang/ControlVideo。
引用
@article{arxiv.2305.13077,
title = {ControlVideo: Training-free Controllable Text-to-Video Generation},
author = {Yabo Zhang and Yuxiang Wei and Dongsheng Jiang and Xiaopeng Zhang and Wangmeng Zuo and Qi Tian},
journal= {arXiv preprint arXiv:2305.13077},
year = {2023}
}
备注
Code is available at https://github.com/YBYBZhang/ControlVideo