中文

TokenFlow:用于一致视频编辑的一致扩散特征

计算机视觉与模式识别 2023-11-21 v3

摘要

生成式 AI 革命近来已扩展至视频。然而,当前最先进的视频模型在视觉质量与用户对生成内容的控制上仍落后于图像模型。本工作中,我们提出一种框架,利用文本到图像扩散模型的力量来完成文本驱动视频编辑任务。具体而言,给定源视频与目标文本提示,我们的方法生成贴合目标文本且保留输入视频空间布局与运动的高质量视频。我们的方法基于一关键观察:编辑视频中的一致性可通过在扩散特征空间中强制一致性来获得。我们依据模型 readily available 的帧间对应关系显式传播扩散特征来实现这一点。因此,我们的框架无需任何训练或微调,且可与任何现成的文本到图像编辑方法协同工作。我们在多种真实世界视频上展示了最先进的编辑结果。网页:https://diffusion-tokenflow.github.io/

关键词

引用

@article{arxiv.2307.10373,
  title  = {TokenFlow: Consistent Diffusion Features for Consistent Video Editing},
  author = {Michal Geyer and Omer Bar-Tal and Shai Bagon and Tali Dekel},
  journal= {arXiv preprint arXiv:2307.10373},
  year   = {2023}
}