中文

FLATTEN:用于一致文本到视频编辑的光流引导注意力

计算机视觉与模式识别 2024-03-04 v3

摘要

文本到视频编辑旨在根据文本提示编辑源视频的视觉外观。该任务的一个主要挑战是确保编辑后视频中的所有帧在视觉上一致。大多数近期工作通过将 U-Net 中的 2D 空间注意力扩展为时空注意力,将先进的文本到图像扩散模型应用于此任务。尽管可通过时空注意力添加时间上下文,但它可能为每个图像块引入一些无关信息,从而导致编辑视频中的不一致。在本文中,我们首次将光流引入扩散模型 U-Net 的注意力模块,以解决文本到视频编辑的不一致问题。我们的方法 FLATTEN 强制不同帧中同一光流路径上的图像块在注意力模块中相互关注,从而改善编辑视频的视觉一致性。此外,我们的方法无需训练,可无缝集成到任何基于扩散的文本到视频编辑方法中并提升其视觉一致性。在现有文本到视频编辑基准上的实验结果表明,我们提出的方法达到了新的 SOTA 性能。特别地,我们的方法在保持编辑视频的视觉一致性方面表现出色。

关键词

引用

@article{arxiv.2310.05922,
  title  = {FLATTEN: optical FLow-guided ATTENtion for consistent text-to-video editing},
  author = {Yuren Cong and Mengmeng Xu and Christian Simon and Shoufa Chen and Jiawei Ren and Yanping Xie and Juan-Manuel Perez-Rua and Bodo Rosenhahn and Tao Xiang and Sen He},
  journal= {arXiv preprint arXiv:2310.05922},
  year   = {2024}
}

备注

Accepted by ICLR2024. Project page: https://flatten-video-editing.github.io/