FastVideoEdit: 利用一致性模型实现高效文本到视频编辑
计算机视觉与模式识别
2024-11-20 v2
摘要
扩散模型在文本到图像和文本到视频生成方面展现出了卓越的能力,为基于文本输入的视频编辑开辟了可能性。然而,扩散模型中顺序采样相关的计算成本对高效视频编辑提出了挑战。依赖图像生成模型进行视频编辑的现有方法存在耗时的单次微调、额外的条件提取或 DDIM inversion 问题,使得实时应用不切实际。在这项工作中,我们提出了 FastVideoEdit,一种受一致性模型 启发的高效零样本视频编辑方法。通过利用 CM 的自一致性属性,我们消除了耗时的反转或额外条件提取的需求,从而减少了编辑时间。我们的方法利用特殊的方差调度,实现了从源视频到目标视频的直接映射,并具有很强的保留能力。这带来了速度优势的提升,因为可以在保持可比生成质量的同时使用更少的采样步骤。实验结果验证了 FastVideoEdit 在涵盖编辑速度、时间一致性和文本-视频对齐的评估指标上的 SOTA 性能和速度优势。
引用
@article{arxiv.2403.06269,
title = {FastVideoEdit: Leveraging Consistency Models for Efficient Text-to-Video Editing},
author = {Youyuan Zhang and Xuan Ju and James J. Clark},
journal= {arXiv preprint arXiv:2403.06269},
year = {2024}
}
备注
Accepted to WACV 2025