中文

利用现成图像扩散模型的零样本视频编辑

计算机视觉与模式识别 2024-01-05 v3

摘要

大规模文本到图像扩散模型在图像生成与编辑中取得前所未有的成功。然而,如何将此类成功扩展到视频编辑尚不清楚。近期视频编辑的初步尝试需要大量文本到视频数据与计算资源进行训练,而这往往难以获取。在本工作中,我们提出 vid2vid-zero,一种简单而有效的零样本视频编辑方法。我们的 vid2vid-zero 利用现成的图像扩散模型,且不需要在任何视频上训练。我们方法的核心是用于文本-视频对齐的空文本反演模块、用于时间一致性的跨帧建模模块,以及用于保真原始视频的空间正则化模块。无需任何训练,我们利用注意力机制的动态特性在测试时实现双向时间建模。实验与分析显示了在真实世界视频中编辑属性、主体、场景等的有前景结果。代码已公开于 \url{https://github.com/baaivision/vid2vid-zero}。

关键词

引用

@article{arxiv.2303.17599,
  title  = {Zero-Shot Video Editing Using Off-The-Shelf Image Diffusion Models},
  author = {Wen Wang and Yan Jiang and Kangyang Xie and Zide Liu and Hao Chen and Yue Cao and Xinlong Wang and Chunhua Shen},
  journal= {arXiv preprint arXiv:2303.17599},
  year   = {2024}
}

备注

Add customized video editing. Under Review