ConditionVideo:无需训练的条件引导文本到视频生成
计算机视觉与模式识别
2024-05-24 v2
摘要
近期工作已成功将大规模文本到图像模型扩展到视频领域,取得了有前景的结果,但计算成本高且需要大量视频数据。在本工作中,我们提出 ConditionVideo,一种基于所提供的条件、视频和输入文本、利用现成文本到图像生成方法(如 Stable Diffusion)的无需训练的文本到视频生成方法。ConditionVideo 从随机噪声或给定场景视频生成逼真的动态视频。我们的方法将运动表示显式解耦为条件引导和场景运动分量。为此,ConditionVideo 模型设计为具有一个 UNet 分支和一个控制分支。为提升时间一致性,我们引入稀疏双向时空注意力(sBiST-Attn)。该 3D 控制网络扩展了传统的 2D controlnet 模型,旨在通过额外利用时域中的双向帧来加强条件生成精度。我们的方法在帧一致性、剪辑分数和条件精度方面表现出优越性能,优于其他对比方法。
引用
@article{arxiv.2310.07697,
title = {ConditionVideo: Training-Free Condition-Guided Text-to-Video Generation},
author = {Bo Peng and Xinyuan Chen and Yaohui Wang and Chaochao Lu and Yu Qiao},
journal= {arXiv preprint arXiv:2310.07697},
year = {2024}
}
备注
AAAI 2024