FreeMask: 重新思考零样子视频编辑中注意力掩码的重要性
计算机视觉与模式识别
2024-10-01 v1 多媒体
摘要
文本到视频扩散模型取得了显著进展。鉴于其能够生成具有时序一致性视频的能力,针对这些基础模型进行零样子视频编辑的研究正快速扩展。为了提升编辑质量,常会在视频编辑中采用结构控制。其中,跨注意力掩码控制因其有效性和效率而居于优势。然而,当将跨注意力掩码应用于视频编辑时,可能会引入模糊和闪烁等伪影。我们的实验发现,前人视频编辑研究中忽略的一个关键因素:跨注意力掩码并非始终清晰,而是随模型结构和去噪时间步的变化而变化。为解决此问题,我们提出度量 Mask Matching Cost (MMC),以量化这种变异性,并提出 FreeMask 方法,以针对特定视频编辑任务选择最佳掩码。使用 MMC 选定的掩码,我们进一步改进了在综合注意力特征(如时序注意力、跨注意力和自注意力模块)中的掩码融合机制。我们的方案可无缝集成到现有的零样子视频编辑框架中,性能更佳,无需控制辅助或参数微调,却实现了对未编辑语义布局的自适应解耦,同时实现掩码精确控制。广泛的实验表明,FreeMask 在语义保真度、时序一致性和编辑质量方面均优于最先进的方法。
引用
@article{arxiv.2409.20500,
title = {FreeMask: Rethinking the Importance of Attention Masks for Zero-Shot Video Editing},
author = {Lingling Cai and Kang Zhao and Hangjie Yuan and Yingya Zhang and Shiwei Zhang and Kejie Huang},
journal= {arXiv preprint arXiv:2409.20500},
year = {2024}
}
备注
Video Editing