MAKIMA:基于掩码引导注意力调制的无调参多属性开放域视频编辑
计算机视觉与模式识别
2024-12-31 v1
摘要
扩散式文本到图像(T2I)模型在全局视频编辑任务中展现出显著成果。然而,这些模型主要关注全局视频修改,实现满足特定属性的精确编辑仍具挑战性,尤其是在多属性编辑(MAE)领域。当前视频编辑方法要么需要大量微调,要么依赖额外网络(如ControlNet)来建模多对象外观,但这些方法仍处于早期阶段,仅提供粗粒度的MAE解决方案。本文提出MAKIMA,一个基于预训练T2I模型构建的无调参MAE框架,用于开放域视频编辑。我们的方法通过在去噪过程中融合注意力图和来自反向过程的特征,保留视频的结构和外观信息。为实现对多个属性的精准编辑,我们引入掩码引导的注意力调制,增强空间对应标记之间的相关性,抑制跨属性干扰,同时作用于自注意力和交叉注意力层。为平衡视频帧生成质量与效率,我们实现一致的特征传播,通过编辑关键帧并在序列中传播其特征来生成帧序列。大量实验表明,MAKIMA在开放域多属性视频编辑任务中超越了现有基线,编辑精度和时序一致性均优于现有方法,同时保持了计算效率。
引用
@article{arxiv.2412.19978,
title = {MAKIMA: Tuning-free Multi-Attribute Open-domain Video Editing via Mask-Guided Attention Modulation},
author = {Haoyu Zheng and Wenqiao Zhang and Zheqi Lv and Yu Zhong and Yang Dai and Jianxiang An and Yongliang Shen and Juncheng Li and Dongping Zhang and Siliang Tang and Yueting Zhuang},
journal= {arXiv preprint arXiv:2412.19978},
year = {2024}
}