EVE:基于深度图引导与时序一致性约束的高效零样本文本视频编辑
计算机视觉与模式识别
2023-08-22 v1 人工智能
摘要
受图像扩散模型卓越性能的激励,越来越多研究者致力于将这些模型扩展至基于文本的视频编辑任务。然而,当前视频编辑任务主要受制于高微调成本与有限生成能力之间的困境。相较图像,我们推测视频在编辑过程中需要更多约束以保全时序一致性。为此,我们提出 EVE,一种鲁棒且高效的零样本视频编辑方法。在深度图与时序一致性约束引导下,EVE 以可接受的计算与时间成本获得满意的视频编辑结果。此外,鉴于缺乏公开可用的视频编辑数据集以进行公平比较,我们构建了新基准 ZVE-50 数据集。通过综合实验,我们验证 EVE 能在性能与效率间取得满意权衡。我们将发布数据集与代码库以裨益未来研究者。
引用
@article{arxiv.2308.10648,
title = {EVE: Efficient zero-shot text-based Video Editing with Depth Map Guidance and Temporal Consistency Constraints},
author = {Yutao Chen and Xingning Dong and Tian Gan and Chunluan Zhou and Ming Yang and Qingpei Guo},
journal= {arXiv preprint arXiv:2308.10648},
year = {2023}
}