文本嵌入并非唯一关键:基于文本自注意力图的文件-图像语义对齐注意力控制
计算机视觉与模式识别
2024-11-26 v1 机器学习
摘要
在文本到图像扩散模型中,每个文本标记的交叉注意力图指示其注意的特定图像区域。比较这些语法相关标记的交叉注意力图可提供关于生成图像是否符合文本提示的洞察。例如,在提示"一辆黑色汽车和一只白色时钟"中,"black"和"car"的交叉注意力图应聚焦于重叠区域以描绘黑色汽车,而"car"和"clock"不应如此。错误的重叠通常会导致缺失物体或属性绑定错误。我们的研究通过调查现有文本到图像模型中的此问题,提出了关键观察:(1) 不同标记之间文本嵌入的相似性——作为条件输入——会导致其交叉注意力图聚焦于同一图像区域;(2) 文本嵌入常常未能忠实捕捉文本注意力图中已存在的语法关系。结果,这些语法关系在交叉注意力模块中可能被忽视,导致图像生成不准确。为此,我们提出一种方法,通过测试时优化将文本注意力图中的语法关系直接传输到交叉注意力模块。我们的做法利用文本注意力图中固有的且未被利用的信息,无需依赖外部指导,即可增强跨多样化提示的图像-文本语义对齐。
引用
@article{arxiv.2411.15236,
title = {Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps},
author = {Jeeyung Kim and Erfan Esmaeili and Qiang Qiu},
journal= {arXiv preprint arXiv:2411.15236},
year = {2024}
}