一个视频价值256个基:用于零样本视频编辑的时空期望最大化反演
计算机视觉与模式识别
2024-06-19 v3
摘要
本文提出了一种用于零样本视频编辑的视频反演方法,该方法在反演过程中用低秩表示对输入视频进行建模。现有的视频编辑方法通常在编辑前应用典型的2D DDIM反演或简单的时空DDIM反演,后者利用每帧的时变表示来推导噪声潜变量。与大多数现有方法不同,我们提出了一种时空期望最大化(STEM)反演,它以期望最大化方式制定密集视频特征,并迭代估计更紧凑的基集来表示整个视频。每帧应用固定的全局表示进行反演,这更有利于重建和编辑过程中的时间一致性。大量的定性和定量实验表明,我们的STEM反演可以在两种最先进的视频编辑方法上实现一致的改进。项目页面:https://stem-inv.github.io/page/。
引用
@article{arxiv.2312.05856,
title = {A Video is Worth 256 Bases: Spatial-Temporal Expectation-Maximization Inversion for Zero-Shot Video Editing},
author = {Maomao Li and Yu Li and Tianyu Yang and Yunfei Liu and Dongxu Yue and Zhihui Lin and Dong Xu},
journal= {arXiv preprint arXiv:2312.05856},
year = {2024}
}
备注
14 pages, Project page: https://stem-inv.github.io/page/