基于注意力调制的稠密文本到图像生成
计算机视觉与模式识别
2023-08-25 v1 图形学
机器学习
摘要
现有文本到图像扩散模型在给定稠密描述(每个文本提示对特定图像区域提供详细描述)时难以合成真实图像。为此,我们提出DenseDiffusion,一种免训练方法,使预训练文本到图像模型适配此类稠密描述,同时提供对场景布局的控制。我们首先分析生成图像布局与预训练模型中间注意力图之间的关系。接着,我们开发一种注意力调制方法,根据布局引导使物体出现在特定区域。无需额外微调或数据集,我们在自动与人工评估分数上均提升了给定稠密描述的图像生成性能。此外,我们取得了与专门以布局条件训练的模型质量相近的视觉结果。
引用
@article{arxiv.2308.12964,
title = {Dense Text-to-Image Generation with Attention Modulation},
author = {Yunji Kim and Jiyoung Lee and Jin-Hwa Kim and Jung-Woo Ha and Jun-Yan Zhu},
journal= {arXiv preprint arXiv:2308.12964},
year = {2023}
}
备注
Accepted by ICCV2023. Code and data are available at https://github.com/naver-ai/DenseDiffusion