基于图像扩散模型编辑时间一致性视频
计算机视觉与模式识别
2024-08-29 v2
摘要
大规模文本到图像(T2I)扩散模型已被扩展用于文本引导的视频编辑,展现出令人印象深刻的零样本视频编辑性能。然而,由于视频的时间特性未被忠实建模,生成的视频通常表现出空间不规则性与时间不一致性。本文中,我们提出一种简洁而有效的时间一致性视频编辑(TCVE)方法,以缓解鲁棒文本引导视频编辑中的时间不一致性挑战。除利用预训练的T2I 2D Unet进行空间内容操控外,我们建立了专用的时序Unet架构,以忠实捕捉输入视频序列的时间连贯性。此外,为在空间聚焦与 temporal 聚焦组件间建立连贯与关联,我们构建了一个聚合的空间-时间建模单元。该单元有效地将时序Unet与预训练的2D Unet相互连接,从而在保留视频内容操控能力的同时增强生成视频的时间一致性。定量实验结果与可视化结果表明,TCVE在视频时间一致性与视频编辑能力方面均达到了最先进的性能,超越了该领域的现有基准。
引用
@article{arxiv.2308.09091,
title = {Edit Temporal-Consistent Videos with Image Diffusion Model},
author = {Yuanzhi Wang and Yong Li and Xiaoya Zhang and Xin Liu and Anbo Dai and Antoni B. Chan and Zhen Cui},
journal= {arXiv preprint arXiv:2308.09091},
year = {2024}
}
备注
10 pages, 7 figures