用于文本到图像生成中强语义绑定的文本词元嵌入几何性质
计算机视觉与模式识别
2025-06-10 v2 人工智能
摘要
在涉及多个对象和属性的复杂场景中,文本到图像(T2I)模型常出现文本与图像不对齐的问题。语义绑定试图通过文本或潜在优化并结合交叉注意力(CA)图的调制,将生成的属性和对象与其对应的名词短语关联起来;然而,影响语义绑定的因素仍有待深入探索。在此,我们研究了文本词元嵌入及其 CA 图的几何性质。我们发现,词元嵌入的几何性质,特别是角距离和范数,是 CA 图区分的关键因素。这些理论发现促使我们提出了一种无需训练的文本嵌入感知 T2I 框架,称为 \textbf{TokeBi},以实现强语义绑定。TokeBi 包含用于区分名词短语间 CA 图的因果感知投影剔除和用于在增强名词短语间分离的同时保持名词短语内 CA 图凝聚力的自适应词元混合。大量实验证实,TokeBi 在多种基线和数据集上均优于现有方法。
引用
@article{arxiv.2503.23011,
title = {Geometrical Properties of Text Token Embeddings for Strong Semantic Binding in Text-to-Image Generation},
author = {Hoigi Seo and Junseo Bang and Haechang Lee and Joohoon Lee and Byung Hyun Lee and Se Young Chun},
journal= {arXiv preprint arXiv:2503.23011},
year = {2025}
}