中文

Attend-and-Excite:基于注意力的文本到图像扩散模型语义引导方法

计算机视觉与模式识别 2023-06-01 v2 计算与语言 图形学 机器学习

摘要

近期的文本到图像生成模型展现出前所未有的能力,能够依据目标文本提示生成多样且富有创意的图像。尽管具有革命性,当前最先进的扩散模型在生成充分传达给定文本提示中语义的图像时仍可能失败。我们分析了公开可用的 Stable Diffusion 模型,并评估了灾难性忽略的存在,即模型未能生成输入提示中的一个或多个主体。此外,我们发现某些情况下模型也未能将属性(如颜色)正确地绑定到相应主体。为缓解这些失败情况,我们引入生成式语义看护(Generative Semantic Nursing, GSN)的概念,即在推理时动态干预生成过程以提升生成图像的忠实度。利用一种基于注意力的 GSN 表述,称为 Attend-and-Excite,我们引导模型细化交叉注意力单元以关注文本提示中的所有主体词元,并增强——或激发——其激活值,促使模型生成文本提示中描述的所有主体。我们将该方法与替代方法进行比较,并证明其在一系列文本提示上更忠实地传达了期望概念。

关键词

引用

@article{arxiv.2301.13826,
  title  = {Attend-and-Excite: Attention-Based Semantic Guidance for Text-to-Image Diffusion Models},
  author = {Hila Chefer and Yuval Alaluf and Yael Vinker and Lior Wolf and Daniel Cohen-Or},
  journal= {arXiv preprint arXiv:2301.13826},
  year   = {2023}
}

备注

Accepted to SIGGRAPH 2023; Project page available at https://yuval-alaluf.github.io/Attend-and-Excite/