中文

InFusion:面向多概念零样本文本驱动视频编辑的注入与注意力融合方法

计算机视觉与模式识别 2023-08-11 v3

摘要

大型文本到图像扩散模型在生成多样、高质量图像方面已取得显著成功。此外,这些模型已通过仅改变文本提示成功用于编辑输入图像。但当这些模型应用于视频时,主要挑战在于确保跨帧的时间一致性与连贯性。本文中,我们提出InFusion,一种利用大型预训练图像扩散模型的零样本文本驱动视频编辑框架。我们的框架特别支持对编辑提示中提及的多种概念进行像素级控制编辑。具体而言,我们注入从解码器层U-Net残差块获得的源提示与编辑提示间的特征差异。当这些与注入的注意力特征结合时,便可查询源内容并缩放已编辑概念,同时注入未编辑部分。编辑通过掩码提取与注意力融合进一步精细控制,其将编辑部分从源中剪切并粘贴至编辑提示的去噪流程中。我们的框架是编辑用一次性调优模型的低成本替代方案,因其无需训练。我们使用LoRA以通用图像模型(Stable Diffusion v1.5)展示了复杂概念编辑。该适配与所有现有图像扩散技术兼容。大量实验结果证明了现有方法在渲染高质量且时间一致视频上的有效性。

关键词

引用

@article{arxiv.2308.00135,
  title  = {InFusion: Inject and Attention Fusion for Multi Concept Zero-Shot Text-based Video Editing},
  author = {Anant Khandelwal},
  journal= {arXiv preprint arXiv:2308.00135},
  year   = {2023}
}

备注

10 pages, 8 figures, 1 Table, accepted at ICCVW 2023 (ICCV 2023 Workshop on AI for Creative Video Editing and Understanding)