中文

驯服基于流的图像到视频模型以实现创意视频编辑

计算机视觉与模式识别 2025-09-29 v1 多媒体

摘要

尽管图像编辑技术取得了显著进展,但旨在根据用户意图操作视频的视频编辑仍然是一个新兴挑战。大多数现有的以图像为条件的视频编辑方法要么需要针对特定模型设计的反演,要么需要大量优化,这限制了它们利用最新的图像到视频(I2V)模型将图像编辑模型的编辑能力迁移到视频领域的能力。为此,我们提出了 IF-V2V,一种无反演方法,能够将现成的基于流匹配的 I2V 模型适配于视频编辑,且无需显著的计算开销。为规避反演,我们设计了带有样本偏差的向量场校正,通过在去噪向量场中引入偏差项,将源视频的信息纳入去噪过程。为了进一步以模型无关的方式确保与源视频的一致性,我们引入了结构与运动保持初始化,以生成嵌入了结构信息的运动感知时间相关噪声。我们还提出了一种偏差缓存机制,以最小化去噪向量校正的额外计算开销,同时不对编辑质量产生显著影响。评估表明,我们的方法实现了优于现有方法的编辑质量与一致性,为实现视觉创造力提供了一种轻量级的即插即用解决方案。

关键词

引用

@article{arxiv.2509.21917,
  title  = {Taming Flow-based I2V Models for Creative Video Editing},
  author = {Xianghao Kong and Hansheng Chen and Yuwei Guo and Lvmin Zhang and Gordon Wetzstein and Maneesh Agrawala and Anyi Rao},
  journal= {arXiv preprint arXiv:2509.21917},
  year   = {2025}
}