中文

Slicedit: 使用时空切片与文生图扩散模型的零样本视频编辑

计算机视觉与模式识别 2024-05-21 v1

摘要

文本到图像(T2I)扩散模型在图像合成与编辑中取得了 SOTA 结果。然而,利用此类预训练模型进行视频编辑被认为是一项重大挑战。许多现有工作试图通过在像素空间或深度特征之间的显式对应机制来强制编辑视频的时间一致性。然而,这些方法在处理强非刚性运动时存在困难。在本文中,我们引入了一种根本不同的方法,该方法基于这样一个观察:自然视频的时空切片展现出与自然图像相似的特征。因此,通常仅用作视频帧先验的同一 T2I 扩散模型,也可以通过将其应用于时空切片,作为增强时间一致性的强先验。基于这一观察,我们提出了 Slicedit,一种基于文本的视频编辑方法,该方法利用预训练的 T2I 扩散模型来处理空间和时空切片。我们的方法生成的视频保留了原始视频的结构和运动,同时遵循目标文本。通过大量实验,我们展示了 Slicedit 编辑各种真实世界视频的能力,证实了其与现有竞争方法相比的明显优势。网页:https://matankleiner.github.io/slicedit/

关键词

引用

@article{arxiv.2405.12211,
  title  = {Slicedit: Zero-Shot Video Editing With Text-to-Image Diffusion Models Using Spatio-Temporal Slices},
  author = {Nathaniel Cohen and Vladimir Kulikov and Matan Kleiner and Inbar Huberman-Spiegelglas and Tomer Michaeli},
  journal= {arXiv preprint arXiv:2405.12211},
  year   = {2024}
}

备注

ICML 2024. Code and examples are available at https://matankleiner.github.io/slicedit/