中文

COVE:释放扩散特征对应关系实现一致视频编辑

计算机视觉与模式识别 2024-12-10 v2

摘要

视频编辑是一项新兴任务,目前大多数方法采用预训练的文本到图像 (T2I) 扩散模型以零样态方式编辑源视频。尽管付出了大量努力,但维持编辑后视频的时间一致性仍具有挑战性,这源于常规 T2I 扩散模型缺乏时间约束。为此,我们提出COrrespondence-guided Video Editing (COVE),利用固有的扩散特征对应关系实现高质量且一致的视频编辑。具体而言,我们提出一种高效的滑动窗口策略,用于计算源视频中扩散特征中标记(token)之间的相似性,识别跨帧具有高对应关系的标记。在反向和去噪过程中,我们基于对应关系对噪声潜在中的标记进行采样,然后在其内部进行自注意力。为节省 GPU 内存使用并加速编辑过程,我们进一步引入时间维度标记合并策略,该策略有效减少冗余。COVE 可无缝集成到预训练的 T2I 扩散模型中,无需额外训练或优化。大量实验结果表明,COVE 在各种视频编辑场景中实现了开创性性能,既在定量上也在定性上均优于现有方法。代码将在 https://github.com/wangjiangshan0725/COVE 发布。

关键词

引用

@article{arxiv.2406.08850,
  title  = {COVE: Unleashing the Diffusion Feature Correspondence for Consistent Video Editing},
  author = {Jiangshan Wang and Yue Ma and Jiayi Guo and Yicheng Xiao and Gao Huang and Xiu Li},
  journal= {arXiv preprint arXiv:2406.08850},
  year   = {2024}
}

备注

NeurIPS 2024