文本到图像生成中的对象-属性绑定:评估与控制
计算机视觉与模式识别
2024-04-23 v1
摘要
当前扩散模型在给定文本提示作为输入时会创建逼真的图像,但在将文本中提及的属性正确绑定到图像中的正确对象方面存在挑战。这一问题通过我们新开发的图像-文本对齐模型 EPViT(Edge Prediction Vision Transformer)进行评估。为缓解上述问题,我们提出了聚焦交叉注意力(FCA),通过输入句子中发现的句法约束控制视觉注意力图。此外,提示的语法结构有助于解耦常用于文本到图像生成的多模态 CLIP 嵌入。 resulting DisCLIP 嵌入和 FCA 可轻松集成到最新的扩散模型中,而无需对这些模型进行额外训练。我们在几个数据集上显示了文本到图像生成的显著改进,尤其是对象-属性绑定方面的改进。\footnote{代码和数据将在接受后公开。}
引用
@article{arxiv.2404.13766,
title = {Object-Attribute Binding in Text-to-Image Generation: Evaluation and Control},
author = {Maria Mihaela Trusca and Wolf Nuyts and Jonathan Thomm and Robert Honig and Thomas Hofmann and Tinne Tuytelaars and Marie-Francine Moens},
journal= {arXiv preprint arXiv:2404.13766},
year = {2024}
}