中文

Edit-A-Video:基于目标感知一致性的单视频编辑

计算机视觉与模式识别 2023-11-20 v4

摘要

尽管文本到视频 (TTV) 模型近期取得了显著成功,但将其扩展至视频编辑的 TTV 方法寥寥无几。受从基于扩散的文本到图像 (TTI) 模型适配的 TTV 模型方法启发,我们提出了仅给定预训练 TTI 模型和单个 <文本, 视频> 对的视频编辑框架,称之为 Edit-A-Video。该框架包含两阶段:(1) 通过追加时序模块并在源视频上微调,将 2D 模型扩展为 3D 模型;(2) 将源视频反演为噪声,并使用目标文本提示与注意力图注入进行编辑。各阶段分别实现源视频的时序建模与语义属性保持。视频编辑的关键挑战之一是背景不一致问题,即未纳入编辑的区域遭受不期望且不一致的时序改动。为缓解此问题,我们还引入了一种新颖的掩码混合方法,称为稀疏因果混合 (SC Blending)。我们改进了以往的掩码混合方法以反映时序一致性,从而使应用编辑的区域呈现平滑过渡,同时实现未编辑区域的时空一致性。我们给出了涵盖各类文本与视频的广泛实验结果,并证明了所提方法在背景一致性、文本对齐和视频编辑质量方面相较基线的优越性。

关键词

引用

@article{arxiv.2303.07945,
  title  = {Edit-A-Video: Single Video Editing with Object-Aware Consistency},
  author = {Chaehun Shin and Heeseung Kim and Che Hyun Lee and Sang-gil Lee and Sungroh Yoon},
  journal= {arXiv preprint arXiv:2303.07945},
  year   = {2023}
}

备注

ACML 2023 Best Paper Award