中文

一个视频价值256个基:用于零样本视频编辑的时空期望最大化反演

计算机视觉与模式识别 2024-06-19 v3

摘要

本文提出了一种用于零样本视频编辑的视频反演方法,该方法在反演过程中用低秩表示对输入视频进行建模。现有的视频编辑方法通常在编辑前应用典型的2D DDIM反演或简单的时空DDIM反演,后者利用每帧的时变表示来推导噪声潜变量。与大多数现有方法不同,我们提出了一种时空期望最大化(STEM)反演,它以期望最大化方式制定密集视频特征,并迭代估计更紧凑的基集来表示整个视频。每帧应用固定的全局表示进行反演,这更有利于重建和编辑过程中的时间一致性。大量的定性和定量实验表明,我们的STEM反演可以在两种最先进的视频编辑方法上实现一致的改进。项目页面:https://stem-inv.github.io/page/。

关键词

引用

@article{arxiv.2312.05856,
  title  = {A Video is Worth 256 Bases: Spatial-Temporal Expectation-Maximization Inversion for Zero-Shot Video Editing},
  author = {Maomao Li and Yu Li and Tianyu Yang and Yunfei Liu and Dongxu Yue and Zhihui Lin and Dong Xu},
  journal= {arXiv preprint arXiv:2312.05856},
  year   = {2024}
}

备注

14 pages, Project page: https://stem-inv.github.io/page/