无需反卷积的单次可控视频编辑的视觉提示
计算机视觉与模式识别
2025-04-22 v1 人工智能
摘要
单次可控视频编辑(OCVE)是一个重要且具有挑战性的任务,旨在传播用户对第一帧视频所做的编辑(使用任何图像编辑工具),以确保后续帧与源帧之间的内容一致。为实现这一目标,先前的方法采用DDIM反卷积将源帧转换为潜在噪声,然后输入预训练的扩散模型,条件为用户编辑后的第一帧,以生成编辑后的视频。然而,DDIM反卷积过程会累积误差,导致潜在噪声无法准确重建源帧,从而损害生成编辑帧的内容一致性。为克服这一问题,我们的方法通过一种新颖的视角消除了DDIM反卷积的需求,通过视觉提示实现OCVE。此外,受一致性模型启发,可以进行多步一致性采样以生成一系列内容一致的图像,我们提出了内容一致性采样(CCS)以确保生成的编辑帧与源帧之间的内容一致性。我们还引入了基于Stein变分梯度下降的时序内容一致性采样(TCS)以确保编辑帧之间的时序一致性。大量实验验证了我们方法的有效性。
引用
@article{arxiv.2504.14335,
title = {Visual Prompting for One-shot Controllable Video Editing without Inversion},
author = {Zhengbo Zhang and Yuxi Zhou and Duo Peng and Joo-Hwee Lim and Zhigang Tu and De Wen Soh and Lin Geng Foo},
journal= {arXiv preprint arXiv:2504.14335},
year = {2025}
}
备注
accepted by cvpr2025