基于即时注意力掩码的高效扩散图像编辑
计算机视觉与模式识别
2024-01-24 v2 人工智能
摘要
基于扩散的图像编辑(DIE)是一个新兴的研究热点,它通常应用语义掩码来控制扩散编辑的目标区域。然而,大多数现有解决方案通过手动操作或离线处理获得这些掩码,大大降低了其效率。在本文中,我们为文本到图像(T2I)扩散模型提出了一种新颖且高效的图像编辑方法,称为即时扩散编辑(InstDiffEdit)。特别地,InstDiffEdit旨在利用现有扩散模型的跨模态注意力能力,在扩散步骤中实现即时的掩码引导。为了减少注意力图的噪声并实现完全自动化,我们为InstDiffEdit配备了一种无需训练的细化方案,以自适应地聚合注意力分布,从而实现自动且准确的掩码生成。同时,为了补充现有的DIE评估,我们提出了一个名为Editing-Mask的新基准,用以检验现有方法的掩码准确性和局部编辑能力。为了验证InstDiffEdit,我们还在ImageNet和Imagen上进行了大量实验,并将其与一系列SOTA方法进行了比较。实验结果表明,InstDiffEdit不仅在图像质量和编辑结果上优于SOTA方法,而且具有更快的推理速度,即快5到6倍。
引用
@article{arxiv.2401.07709,
title = {Towards Efficient Diffusion-Based Image Editing with Instant Attention Masks},
author = {Siyu Zou and Jiji Tang and Yiyi Zhou and Jing He and Chaoyi Zhao and Rongsheng Zhang and Zhipeng Hu and Xiaoshuai Sun},
journal= {arXiv preprint arXiv:2401.07709},
year = {2024}
}
备注
Accepted by AAAI2024