LOVECon:基于 ControlNet 的文本驱动免训练长视频编辑
计算机视觉与模式识别
2024-05-29 v3
摘要
利用预训练的条件扩散模型进行无需进一步微调的视频编辑,因其在影视制作、广告等领域的潜力而受到越来越多的关注。然而,该方向的代表性工作在生成长度、时间一致性或对源视频的保真度方面存在不足。本文旨在弥补这些差距,建立一个简单有效的基于免训练扩散模型的长视频编辑基线。如先前工作所建议,我们基于 ControlNet 构建流水线,其在基于文本提示的各类图像编辑任务中表现出色。为打破有限计算内存导致的长度限制,我们将长视频分割为连续窗口,并提出了一种新颖的跨窗口注意力机制,以确保全局风格的一致性并最大化窗口间的平滑性。为实现更精确的控制,我们通过 DDIM 反演从源视频中提取信息,并将结果整合到生成的潜状态中。我们还引入视频帧插值模型以缓解帧级闪烁问题。大量实证研究表明,我们的方法在包括前景物体属性替换、风格迁移和背景替换等场景下,相对于对比基线具有更优的效果。此外,我们的方法能够根据用户需求编辑包含数百帧的视频。我们的项目已开源,项目页面位于 https://github.com/zhijie-group/LOVECon。
引用
@article{arxiv.2310.09711,
title = {LOVECon: Text-driven Training-Free Long Video Editing with ControlNet},
author = {Zhenyi Liao and Zhijie Deng},
journal= {arXiv preprint arXiv:2310.09711},
year = {2024}
}
备注
AI for Content Creation Workshop @ CVPR 2024