基于注意力重聚焦的基础化文本到图像合成
计算机视觉与模式识别
2023-12-06 v2
摘要
在大规模数据集上训练的可扩展扩散模型驱动下,文本到图像合成方法已展现出令人信服的结果。然而,这些模型仍无法精确遵循涉及多个对象、属性或空间组合的文本提示。本文中,我们揭示了扩散模型交叉注意力与自注意力层中的潜在原因。我们提出两种新颖损失,在采样过程中根据给定的空间布局重聚焦注意力图。手动创建布局需要额外精力且可能繁琐。因此,我们探索使用大型语言模型(LLM)为本方法生成这些布局。我们在 DrawBench、HRS 和 TIFA 基准上进行了广泛实验以评估所提方法。我们表明,所提出的注意力重聚焦有效提升了现有方法的可控性。
引用
@article{arxiv.2306.05427,
title = {Grounded Text-to-Image Synthesis with Attention Refocusing},
author = {Quynh Phung and Songwei Ge and Jia-Bin Huang},
journal= {arXiv preprint arXiv:2306.05427},
year = {2023}
}
备注
Project page: https://attention-refocusing.github.io/