中文

FastVideoEdit: 利用一致性模型实现高效文本到视频编辑

计算机视觉与模式识别 2024-11-20 v2

摘要

扩散模型在文本到图像和文本到视频生成方面展现出了卓越的能力,为基于文本输入的视频编辑开辟了可能性。然而,扩散模型中顺序采样相关的计算成本对高效视频编辑提出了挑战。依赖图像生成模型进行视频编辑的现有方法存在耗时的单次微调、额外的条件提取或 DDIM inversion 问题,使得实时应用不切实际。在这项工作中,我们提出了 FastVideoEdit,一种受一致性模型 启发的高效零样本视频编辑方法。通过利用 CM 的自一致性属性,我们消除了耗时的反转或额外条件提取的需求,从而减少了编辑时间。我们的方法利用特殊的方差调度,实现了从源视频到目标视频的直接映射,并具有很强的保留能力。这带来了速度优势的提升,因为可以在保持可比生成质量的同时使用更少的采样步骤。实验结果验证了 FastVideoEdit 在涵盖编辑速度、时间一致性和文本-视频对齐的评估指标上的 SOTA 性能和速度优势。

关键词

引用

@article{arxiv.2403.06269,
  title  = {FastVideoEdit: Leveraging Consistency Models for Efficient Text-to-Video Editing},
  author = {Youyuan Zhang and Xuan Ju and James J. Clark},
  journal= {arXiv preprint arXiv:2403.06269},
  year   = {2024}
}

备注

Accepted to WACV 2025