中文

ConditionVideo:无需训练的条件引导文本到视频生成

计算机视觉与模式识别 2024-05-24 v2

摘要

近期工作已成功将大规模文本到图像模型扩展到视频领域,取得了有前景的结果,但计算成本高且需要大量视频数据。在本工作中,我们提出 ConditionVideo,一种基于所提供的条件、视频和输入文本、利用现成文本到图像生成方法(如 Stable Diffusion)的无需训练的文本到视频生成方法。ConditionVideo 从随机噪声或给定场景视频生成逼真的动态视频。我们的方法将运动表示显式解耦为条件引导和场景运动分量。为此,ConditionVideo 模型设计为具有一个 UNet 分支和一个控制分支。为提升时间一致性,我们引入稀疏双向时空注意力(sBiST-Attn)。该 3D 控制网络扩展了传统的 2D controlnet 模型,旨在通过额外利用时域中的双向帧来加强条件生成精度。我们的方法在帧一致性、剪辑分数和条件精度方面表现出优越性能,优于其他对比方法。

关键词

引用

@article{arxiv.2310.07697,
  title  = {ConditionVideo: Training-Free Condition-Guided Text-to-Video Generation},
  author = {Bo Peng and Xinyuan Chen and Yaohui Wang and Chaochao Lu and Yu Qiao},
  journal= {arXiv preprint arXiv:2310.07697},
  year   = {2024}
}

备注

AAAI 2024