解耦内容与运动的条件图像到视频生成
计算机视觉与模式识别
2023-12-15 v2
摘要
条件图像到视频(cI2V)生成的目标是以条件(即一张图像与文本)为起点,创作一段可信的新视频。以往的cI2V生成方法常规地在RGB像素空间中进行,在运动一致性与视觉连续性建模方面存在局限。此外,在像素空间中生成视频的效率相当低下。本文提出一种新方法以应对这些挑战:将目标RGB像素解耦为两个不同分量,即空间内容与时间运动。具体而言,我们基于3D-UNet扩散模型预测包含运动向量与残差的时间运动。通过显式建模时间运动并将其扭曲至起始图像,我们提升了生成视频的时间一致性。这减少了空间冗余,突出了时间细节。所提方法通过解耦内容与运动实现了性能提升,且未给模型引入新的结构复杂性。在多个数据集上的大量实验证实,我们的方法在效果与效率上均优于大多数SOTA方法。
引用
@article{arxiv.2311.14294,
title = {Decouple Content and Motion for Conditional Image-to-Video Generation},
author = {Cuifeng Shen and Yulu Gan and Chen Chen and Xiongwei Zhu and Lele Cheng and Tingting Gao and Jinzhi Wang},
journal= {arXiv preprint arXiv:2311.14294},
year = {2023}
}