DNI: 用于扩散视频编辑的稀释噪声初始化
计算机视觉与模式识别
2024-09-23 v1
摘要
基于文本的扩散视频编辑系统在执行具有高保真度和文本一致性的编辑方面取得了成功。然而,这种成功仅限于刚性类型的编辑(如风格迁移和物体叠加),同时保留了输入视频的原始结构。这种局限性源于扩散视频编辑系统中使用的初始潜噪声。扩散视频编辑系统通过将高斯噪声逐渐注入输入视频来准备用于编辑的初始潜噪声。然而,我们观察到输入视频的视觉结构仍然保留在该初始潜噪声中,从而限制了需要结构性修改的非刚性编辑(如运动变化)。为此,本文提出了稀释噪声初始化(DNI)框架,使编辑系统能够执行包括非刚性编辑在内的精确且动态的修改。DNI 引入了“噪声稀释”的概念,即在待编辑区域的潜噪声中添加额外噪声,以软化输入视频施加的结构刚性,从而实现更接近目标提示的有效编辑。大量实验证明了 DNI 框架的有效性。
引用
@article{arxiv.2409.13037,
title = {DNI: Dilutional Noise Initialization for Diffusion Video Editing},
author = {Sunjae Yoon and Gwanhyeong Koo and Ji Woo Hong and Chang D. Yoo},
journal= {arXiv preprint arXiv:2409.13037},
year = {2024}
}
备注
17 pages, 11 figures, ECCV 2024