VidEdit:零样本且具空间感知的文本驱动视频编辑
计算机视觉与模式识别
2024-04-03 v4
摘要
近年来,基于扩散的生成模型在图像生成与编辑方面取得了显著成功。然而,现有的基于扩散的视频编辑方法缺乏在长视频中保持时间一致性的精确内容控制能力。另一方面,基于图集(atlas)的方法提供了较强的时间一致性,但编辑视频代价高昂且缺乏空间控制。在本工作中,我们提出 VidEdit,一种用于零样本文本驱动视频编辑的新方法,可保证鲁棒的时间与空间一致性。具体而言,我们将基于图集的视频表示与预训练的文本到图像扩散模型相结合,提供一种无需训练且高效的视频编辑方法,其设计天然满足时间平滑性。为赋予用户对生成内容的精确控制,我们利用从现成的全景分割器(panoptic segmenter)与边缘检测器中提取的条件信息来引导扩散采样过程。该方法在对目标区域实现精细空间控制的同时,严格保留原始视频的结构。我们的定量与定性实验表明,在 DAVIS 数据集上,VidEdit 在语义保真度、图像保持与时间一致性指标方面均优于当前最优(state-of-the-art)方法。借助该框架,处理单个视频仅需约一分钟,且可基于唯一文本提示生成多个兼容的编辑结果。项目主页:https://videdit.github.io
引用
@article{arxiv.2306.08707,
title = {VidEdit: Zero-Shot and Spatially Aware Text-Driven Video Editing},
author = {Paul Couairon and Clément Rambour and Jean-Emmanuel Haugeard and Nicolas Thome},
journal= {arXiv preprint arXiv:2306.08707},
year = {2024}
}
备注
TMLR 2024. Project web-page at https://videdit.github.io