中文

划分与绑定注意力以改进生成式语义引导

计算机视觉与模式识别 2024-07-16 v3 人工智能 计算与语言 机器学习

摘要

新兴的大规模文本到图像生成模型,例如 Stable Diffusion (SD),已展现出高保真的压倒性结果。尽管取得了巨大进展,当前最先进的模型仍难以生成完全遵循输入提示的图像。先前的工作 Attend & Excite 引入了生成式语义引导(GSN)的概念,旨在推理时优化交叉注意力以更好地融入语义。它在生成简单提示(例如“一只猫和一只狗”)时展示了有前景的结果。然而,其在处理更复杂提示时效果下降,且未明确解决属性绑定不当的问题。为应对复杂提示或多实体场景带来的挑战并实现改进的属性绑定,我们提出 Divide & Bind。我们为 GSN 引入两个新颖的损失目标:一种新颖的出席损失和一种绑定损失。我们的方法突出之处在于能够从复杂提示中忠实地合成所需对象并改进属性对齐,且在多个评估基准上展现出优越性能。

关键词

引用

@article{arxiv.2307.10864,
  title  = {Divide & Bind Your Attention for Improved Generative Semantic Nursing},
  author = {Yumeng Li and Margret Keuper and Dan Zhang and Anna Khoreva},
  journal= {arXiv preprint arXiv:2307.10864},
  year   = {2024}
}

备注

Accepted at BMVC 2023 as Oral. Code: https://github.com/boschresearch/Divide-and-Bind and project page: https://sites.google.com/view/divide-and-bind