Videoshop:基于噪声外推扩散反演的局部语义视频编辑
计算机视觉与模式识别
2024-10-28 v3 人工智能
机器学习
摘要
我们引入了Videoshop,一种用于局部语义编辑的免训练视频编辑算法。Videoshop允许用户使用任何编辑软件(包括Photoshop和生成式修复)来修改第一帧;它会自动将这些更改以语义、空间和时间上一致的运动传播到剩余帧中。与仅通过不精确的文本指令进行编辑的现有方法不同,Videoshop允许用户添加或移除对象、语义上改变对象、将图库照片插入视频等,并对位置和外观具有细粒度的控制。我们通过基于图像的视频编辑实现了这一点,具体方式是对带有噪声外推的潜变量进行反演,并以此为基础生成以编辑后的图像为条件的视频。在2个编辑基准上使用10个评估指标,Videoshop相较于6个基线方法产生了更高质量的编辑效果。
引用
@article{arxiv.2403.14617,
title = {Videoshop: Localized Semantic Video Editing with Noise-Extrapolated Diffusion Inversion},
author = {Xiang Fan and Anand Bhattad and Ranjay Krishna},
journal= {arXiv preprint arXiv:2403.14617},
year = {2024}
}
备注
Accepted to ECCV 2024. Project page: https://videoshop-editing.github.io/