Dreamix:视频扩散模型是通用视频编辑器
计算机视觉与模式识别
2023-02-03 v1
摘要
文本驱动的图像和视频扩散模型近期实现了前所未有的生成真实感。虽然扩散模型已成功应用于图像编辑,但极少有工作将其用于视频编辑。我们提出了首个基于扩散的方法,能够对通用视频进行基于文本的运动和外观编辑。我们的方法在推理时使用视频扩散模型,将原始视频的低分辨率时空信息与其合成的、与引导文本提示对齐的新高分辨率信息相结合。由于高保真地还原原始视频需要保留其部分高分辨率信息,我们增加了一个在原始视频上微调模型的预备阶段,显著提升了保真度。我们提出通过一种新的混合目标来改进运动可编辑性,该目标联合使用全时序注意力和时序注意力掩码进行微调。我们进一步引入了一种新的图像动画框架。我们首先通过复制和透视几何投影等简单图像处理操作将图像转换为粗略视频,然后使用我们的通用视频编辑器为其添加动画。作为进一步应用,我们的方法还可用于主体驱动的视频生成。大量定性和定量实验展示了我们方法卓越的编辑能力,并确立了其相对于基线方法的优越性能。
引用
@article{arxiv.2302.01329,
title = {Dreamix: Video Diffusion Models are General Video Editors},
author = {Eyal Molad and Eliahu Horwitz and Dani Valevski and Alex Rav Acha and Yossi Matias and Yael Pritch and Yaniv Leviathan and Yedid Hoshen},
journal= {arXiv preprint arXiv:2302.01329},
year = {2023}
}