中文

注意力重叠是文本到图像扩散模型中实体缺失问题的原因!

计算机视觉与模式识别 2025-03-25 v2

摘要

文本到图像扩散模型,如Stable Diffusion和DALL-E,能够根据文本提示生成高质量、多样化且逼真的图像。然而,它们有时难以准确描绘提示中描述的特定实体,这一局限性被称为组合生成中的实体缺失问题。尽管先前的研究表明,在去噪过程中调整交叉注意力图可以缓解此问题,但它们并未系统性地研究哪种目标函数能最好地解决该问题。本研究聚焦于交叉注意力动态,探讨了实体缺失问题的三个潜在原因:(1)某些实体的注意力强度不足,(2)注意力分布过于广泛,以及(3)不同实体的注意力图之间过度重叠。我们发现,减少实体间注意力图的重叠可以有效降低实体缺失率。具体来说,我们假设在去噪过程中,与特定实体相关的词元会竞争某些图像区域的注意力,这可能导致注意力在词元间分散,并阻碍每个实体的准确表示。为了解决这个问题,我们引入了四种损失函数:交并比(IoU)、质心(CoM)距离、KL散度(KL散度)和聚类紧凑度(CC),以在去噪步骤中调节注意力重叠,无需重新训练。在多种基准上的实验结果表明,这些提出的免训练方法显著提高了组合准确性,在视觉问答(VQA)、图像描述评分、CLIP相似度和人类评估方面均优于先前的方法。值得注意的是,这些方法将人类评估分数比最佳基线提高了9%,证明了组合对齐方面的显著改进。

关键词

引用

@article{arxiv.2410.20972,
  title  = {Attention Overlap Is Responsible for The Entity Missing Problem in Text-to-image Diffusion Models!},
  author = {Arash Marioriyad and Mohammadali Banayeeanzade and Reza Abbasi and Mohammad Hossein Rohban and Mahdieh Soleymani Baghshah},
  journal= {arXiv preprint arXiv:2410.20972},
  year   = {2025}
}

备注

TMLR - 2025