FateZero:融合注意力实现零样本基于文本的视频编辑
计算机视觉与模式识别
2023-10-12 v3
摘要
基于扩散的生成模型在基于文本的图像生成中取得了显著成功。然而,由于生成过程包含巨大的随机性,将此类模型应用于真实世界视觉内容编辑(尤其是视频)仍具挑战性。本文中,我们提出FateZero,一种无需逐提示训练或使用特定掩码的真实世界视频零样本文本编辑方法。为一致地编辑视频,我们基于预训练模型提出了若干技术。首先,与直接的DDIM反演技术不同,我们的方法在反演过程中捕获中间注意力图,有效保留结构与运动信息。这些图在编辑过程中直接融合,而非在去噪时生成。为进一步最小化源视频的语义泄漏,我们随后将自注意力与由源提示交叉注意力特征获得的混合掩码相融合。此外,我们通过在去噪UNet中引入时空注意力改革了自注意力机制,以确保帧间一致性。尽管简洁,我们的方法是首个展示从训练的文本到图像模型进行零样本文本驱动视频风格与局部属性编辑能力的方法。基于文本到视频模型,我们还具备更好的零样本形状感知编辑能力。大量实验证明了我们优于先前工作的时序一致性与编辑能力。
引用
@article{arxiv.2303.09535,
title = {FateZero: Fusing Attentions for Zero-shot Text-based Video Editing},
author = {Chenyang Qi and Xiaodong Cun and Yong Zhang and Chenyang Lei and Xintao Wang and Ying Shan and Qifeng Chen},
journal= {arXiv preprint arXiv:2303.09535},
year = {2023}
}
备注
Accepted to ICCV 2023 as an Oral Presentation. Project page: https://fate-zero-edit.github.io ; GitHub repository: https://github.com/ChenyangQiQi/FateZero