文本到图像扩散模型中基于对象条件的能量注意力图对齐
计算机视觉与模式识别
2024-10-10 v2
摘要
文本到图像扩散模型在生成高质量文本引导图像方面取得了巨大成功。然而,这些模型在将生成图像与提供的文本提示进行语义对齐时仍可能失败,导致诸如属性绑定错误和/或严重忽略对象等问题。鉴于文本提示中普遍存在的面向对象结构,我们引入了一种新颖的基于对象条件的能量注意力图对齐(EBAMA)方法来解决上述问题。我们证明了,在负采样技术的帮助下,通过近似最大化 参数化能量基模型的对数似然,以对象为中心的属性绑定损失会自然涌现。我们进一步提出了一种以对象为中心的强度正则化器,以防止对象的注意力向其属性过度转移。在多个具有挑战性的基准上进行的大量定性和定量实验(包括人工评估)表明,我们的方法优于以往强大的对比方法。凭借更好的对齐注意力图,我们的方法在进一步增强扩散模型的文本控制图像编辑能力方面展现出巨大潜力。
引用
@article{arxiv.2404.07389,
title = {Object-Conditioned Energy-Based Attention Map Alignment in Text-to-Image Diffusion Models},
author = {Yasi Zhang and Peiyu Yu and Ying Nian Wu},
journal= {arXiv preprint arXiv:2404.07389},
year = {2024}
}
备注
Accepted to ECCV 2024