Lumiere:一种用于视频生成的时空扩散模型
计算机视觉与模式识别
2024-02-06 v2
摘要
我们介绍了Lumiere——一种文本到视频的扩散模型,旨在合成具有逼真、多样且连贯运动的视频,这是视频合成中的一个关键挑战。为此,我们引入了一种时空U-Net架构,该架构通过模型中的单次传递,一次性生成视频的整个时间长度。这与现有的视频模型形成对比,后者先合成远距离关键帧,再进行时间超分辨率——这种方法本质上难以实现全局时间一致性。通过部署空间和(重要的)时间下采样与上采样,并利用预训练的文本到图像扩散模型,我们的模型学会了通过在多个时空尺度上处理视频,直接生成全帧率、低分辨率的视频。我们展示了最先进的文本到视频生成结果,并表明我们的设计轻松支持了广泛的内容创作任务和视频编辑应用,包括图像到视频、视频修复和风格化生成。
引用
@article{arxiv.2401.12945,
title = {Lumiere: A Space-Time Diffusion Model for Video Generation},
author = {Omer Bar-Tal and Hila Chefer and Omer Tov and Charles Herrmann and Roni Paiss and Shiran Zada and Ariel Ephrat and Junhwa Hur and Guanghui Liu and Amit Raj and Yuanzhen Li and Michael Rubinstein and Tomer Michaeli and Oliver Wang and Deqing Sun and Tali Dekel and Inbar Mosseri},
journal= {arXiv preprint arXiv:2401.12945},
year = {2024}
}
备注
Webpage: https://lumiere-video.github.io/ | Video: https://www.youtube.com/watch?v=wxLr02Dz2Sc