关于稳定扩散中交叉注意力和自注意力的理解
计算机视觉与模式识别
2024-03-07 v1
摘要
深度文本到图像合成(TIS)模型如稳定扩散(Stable Diffusion)最近因创意文本到图像生成而获得了广泛关注。然而,对于面向特定领域的场景,无需调优的文本引导图像编辑(TIE)更为重要,这类技术通过在生成过程中操控注意力层的特征组件来修改图像中的对象或对象属性。然而,人们对这些注意力层学习了哪些语义含义以及注意力图的哪些部分对图像编辑成功有贡献知之甚少。本文进行了深入的探针性分析,表明稳定扩散中的交叉注意力图常常包含可导致编辑失败的对象归因信息。相比之下,自注意力图在将源图像的几何和形状细节转化为目标图像方面起着关键作用。我们的分析为理解扩散模型中的交叉和自注意力图提供了宝贵的见解。此外,基于我们的发现,我们简化了流行的图像编辑方法,提出一种更直接且更稳定、更高效的无需调优的程序,仅在去噪过程中修改指定注意力层的自注意力图。实验结果表明,我们的简化方法在多个数据集上 consistently 优于流行方法。
引用
@article{arxiv.2403.03431,
title = {Towards Understanding Cross and Self-Attention in Stable Diffusion for Text-Guided Image Editing},
author = {Bingyan Liu and Chengyu Wang and Tingfeng Cao and Kui Jia and Jun Huang},
journal= {arXiv preprint arXiv:2403.03431},
year = {2024}
}