面向基于提示的图像编辑的视觉引导和掩码增强的自适应去噪
计算机视觉与模式识别
2024-11-19 v2
摘要
文本到图像扩散模型在从文本提示合成高质量图像方面取得了显著进展,这推动了基于提示的图像编辑研究,即根据目标提示编辑源图像。尽管取得了进展,现有方法仍面临三个关键问题:1)文本提示在引导目标图像生成方面的容量有限,2)Insufficient mining of word-to-patch 和 patch-to-patch 之间的关系以定位编辑区域,3)在每个去噪步骤中对所有区域统一的编辑强度。为解决这些问题,我们提出了一种基于视觉引导和掩码增强的自适应编辑方法(ViMAEdit),包含三个关键新设计。首先,我们提出利用图像嵌入作为显式指导,来增强常规基于文本提示的去噪过程,其中引入了基于 CLIP 的目标图像嵌入估计策略。其次,我们设计了一种基于自注意力的迭代编辑区域定位策略,通过自注意力图传达的 patch-to-patch 关系,不断细化包含在跨注意力图中的 word-to-patch 关系。最后,我们提出了基于空间自适应方差的抽样方法,突出显示关键图像区域的抽样方差,以促进编辑能力。实验结果表明,ViMAEdit 在所有现有方法上都表现出卓越的编辑能力。
引用
@article{arxiv.2410.10496,
title = {Vision-guided and Mask-enhanced Adaptive Denoising for Prompt-based Image Editing},
author = {Kejie Wang and Xuemeng Song and Meng Liu and Jin Yuan and Weili Guan},
journal= {arXiv preprint arXiv:2410.10496},
year = {2024}
}