RAVE:用于扩散模型快速且一致性视频编辑的随机化噪声混洗
计算机视觉与模式识别
2023-12-08 v1
摘要
基于扩散的模型的最新进展在从文本生成图像方面取得了显著成功。然而,视频编辑模型尚未达到相同水平的视觉质量和用户控制。为了解决这个问题,我们引入了 RAVE,这是一种零样本视频编辑方法,它利用预训练的文本到图像扩散模型,无需额外训练。RAVE 接受一个输入视频和一个文本提示,以生成高质量视频,同时保留原始运动和语义结构。它采用了一种新颖的噪声混洗策略,利用帧之间的时空交互,以比现有方法更快的速度生成时间一致的视频。它在内存需求方面也很高效,使其能够处理更长的视频。RAVE 能够进行广泛的编辑,从局部属性修改到形状变换。为了展示 RAVE 的多功能性,我们创建了一个全面的视频评估数据集,范围从以物体为中心的场景到复杂的人类活动(如跳舞和打字),以及以游动的鱼和船为特色的动态场景。我们的定性和定量实验突出了 RAVE 在各种视频编辑场景中与现有方法相比的有效性。我们的代码、数据集和视频可以在 https://rave-video.github.io 找到。
引用
@article{arxiv.2312.04524,
title = {RAVE: Randomized Noise Shuffling for Fast and Consistent Video Editing with Diffusion Models},
author = {Ozgur Kara and Bariscan Kurtkaya and Hidir Yesiltepe and James M. Rehg and Pinar Yanardag},
journal= {arXiv preprint arXiv:2312.04524},
year = {2023}
}
备注
Project webpage: https://rave-video.github.io , Github: http://github.com/rehg-lab/RAVE