MoVideo:基于扩散模型的运动感知视频生成
计算机视觉与模式识别
2024-07-31 v2 图像与视频处理
摘要
尽管近年来利用扩散模型进行视频生成取得了巨大进展,但大多数方法都是图像生成框架的简单扩展,未能显式考虑视频与图像的关键区别之一,即运动。本文提出一种新颖的运动感知视频生成(MoVideo)框架,从视频深度与光流两个方面考虑运动。前者通过逐帧物体距离与空间布局来调控运动,后者通过跨帧对应关系描述运动,有助于保留细节并提升时间一致性。具体而言,给定由文本提示存在或生成的关键帧,我们首先设计带时空模块的扩散模型生成视频深度与相应光流;随后,在深度、基于光流的扭曲潜变量视频及计算所得遮挡掩码引导下,由另一时空扩散模型在潜变量空间中生成视频;最后,再次利用光流对齐并细化不同帧,以更好地从潜变量空间解码至像素空间。实验中,MoVideo 在文本到视频与图像到视频生成上均取得最先进(state-of-the-art)结果,展现出良好的提示一致性、帧一致性与视觉质量。
引用
@article{arxiv.2311.11325,
title = {MoVideo: Motion-Aware Video Generation with Diffusion Models},
author = {Jingyun Liang and Yuchen Fan and Kai Zhang and Radu Timofte and Luc Van Gool and Rakesh Ranjan},
journal= {arXiv preprint arXiv:2311.11325},
year = {2024}
}
备注
Accepted by ECCV2024. Project page: https://jingyunliang.github.io/MoVideo