中文

Cut-and-Paste:基于注意力控制的主体驱动视频编辑

计算机视觉与模式识别 2023-11-21 v1

摘要

本文提出一种称为Cut-and-Paste的新颖框架,用于在文本提示和额外参考图像引导下进行的真实世界语义视频编辑。尽管文本驱动视频编辑已展现出根据给定文本提示生成高度多样视频的卓越能力,但仅通过纯文本提示很难在对象细节和编辑区域方面控制细粒度语义编辑,且该任务通常需要繁琐的长文本描述。因此我们研究主体驱动视频编辑,以实现对编辑区域和背景保留以及细粒度语义生成的更精确控制。我们通过将参考图像作为文本驱动视频编辑的补充输入来实现此目标,从而避免绞尽脑汁构思描述对象详细外观的繁琐文本提示。为限制编辑区域,我们借鉴图像编辑中的交叉注意力控制方法,并通过融合相邻帧的注意力图将其成功扩展到视频编辑,在保持视频背景与时空一致性之间取得平衡。与现有方法相比,我们方法的整个过程如同将源对象“剪切”下来编辑,再将参考图像提供的目标对象“粘贴”上去。我们证明,在文本提示和额外参考图像引导下的视频编辑中,我们的方法在定量和主观评估上均优于先前方法。

关键词

引用

@article{arxiv.2311.11697,
  title  = {Cut-and-Paste: Subject-Driven Video Editing with Attention Control},
  author = {Zhichao Zuo and Zhao Zhang and Yan Luo and Yang Zhao and Haijun Zhang and Yi Yang and Meng Wang},
  journal= {arXiv preprint arXiv:2311.11697},
  year   = {2023}
}