中文

用于文本到图像合成中免训练语义绑定的Token合并

计算机视觉与模式识别 2024-11-12 v1 人工智能

摘要

尽管文本到图像模型展现出卓越的生成能力,但它们经常无法准确绑定输入提示中语义相关的对象或属性;这一挑战被称为语义绑定。先前的方法要么需要对整个T2I模型进行密集微调,要么需要用户或大型语言模型指定生成布局,增加了复杂性。在本文中,我们将语义绑定定义为将给定对象与其属性关联的任务(称为属性绑定),或将其与其他相关子对象链接的任务(称为对象绑定)。我们引入了一种名为Token合并的新方法,该方法通过将相关Token聚合到一个单一的复合Token中来增强语义绑定。这确保了对象、其属性和子对象都共享相同的交叉注意力图。此外,为了解决复杂文本提示中主要对象之间的潜在混淆,我们提出了结束Token替换作为补充策略。为了在T2I生成的初始阶段(即确定布局时)进一步优化我们的方法,我们引入了两个辅助损失,一个熵损失和一个语义绑定损失,以迭代更新复合Token,从而提高生成完整性。我们进行了大量实验来验证ToMe的有效性,并将其与T2I-CompBench和我们提出的GPT-4o对象绑定基准上的各种现有方法进行了比较。我们的方法在涉及多个对象和属性的复杂场景中特别有效,而先前的方法通常无法解决这些问题。代码将在\url{https://github.com/hutaihang/ToMe}公开提供。

关键词

引用

@article{arxiv.2411.07132,
  title  = {Token Merging for Training-Free Semantic Binding in Text-to-Image Synthesis},
  author = {Taihang Hu and Linxuan Li and Joost van de Weijer and Hongcheng Gao and Fahad Shahbaz Khan and Jian Yang and Ming-Ming Cheng and Kai Wang and Yaxing Wang},
  journal= {arXiv preprint arXiv:2411.07132},
  year   = {2024}
}

备注

Accepted by Neurips2024