中文

基于注意力重聚焦的基础化文本到图像合成

计算机视觉与模式识别 2023-12-06 v2

摘要

在大规模数据集上训练的可扩展扩散模型驱动下,文本到图像合成方法已展现出令人信服的结果。然而,这些模型仍无法精确遵循涉及多个对象、属性或空间组合的文本提示。本文中,我们揭示了扩散模型交叉注意力与自注意力层中的潜在原因。我们提出两种新颖损失,在采样过程中根据给定的空间布局重聚焦注意力图。手动创建布局需要额外精力且可能繁琐。因此,我们探索使用大型语言模型(LLM)为本方法生成这些布局。我们在 DrawBench、HRS 和 TIFA 基准上进行了广泛实验以评估所提方法。我们表明,所提出的注意力重聚焦有效提升了现有方法的可控性。

关键词

引用

@article{arxiv.2306.05427,
  title  = {Grounded Text-to-Image Synthesis with Attention Refocusing},
  author = {Quynh Phung and Songwei Ge and Jia-Bin Huang},
  journal= {arXiv preprint arXiv:2306.05427},
  year   = {2023}
}

备注

Project page: https://attention-refocusing.github.io/