中文

为文本到图像模型中的空间关系对齐提供概率视角:为何需要选择Mid

计算机视觉与模式识别 2025-07-01 v1

摘要

尽管文本到图像模型能够生成高质量、真实且多样的图像,但在组成性生成方面仍面临挑战,往往难以准确表示输入提示中指定的细节。文本到图像模型中常见的组成性问题是空间关系错位,因为模型常常无法忠实地生成反映输入提示中对象之间指定空间配置的图像。为解决这一挑战,我们提出了一种新颖的概率框架,用于建模场景中对象的相对空间位置,利用概率优势概念(Probability of Superiority, PoS)。在此基础上,我们作出了两个关键贡献。首先,我们引入了一种新颖的评估指标,基于PoS的评估(PoS-based Evaluation, PSE),旨在评估文本与图像之间2D和3D空间关系的对齐情况,更符合人类判断。其次,我们提出了基于PoS的生成(PoS-based Generation, PSG),这是一种无需微调的推理时方法,可提高文本到图像模型中2D和3D空间关系的对齐程度。PSG采用基于词性的PoS奖励函数,可以两种不同方式使用:(1)作为应用于去噪步骤中交叉注意力图的梯度引导机制,或(2)作为评估一组初始噪声向量以选择最佳一个的搜索策略。大量实验表明,PSE指标在符合人类判断方面优于传统基于中心的指标,为文本图像对齐中复杂空间关系精度提供了更细致可靠的衡量标准。此外,PSG显著提高了文本到图像模型生成具有指定空间配置图像的能力,在多个评估指标和基准测试中均优于最先进的方法。

关键词

引用

@article{arxiv.2506.23418,
  title  = {Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models},
  author = {Parham Rezaei and Arash Marioriyad and Mahdieh Soleymani Baghshah and Mohammad Hossein Rohban},
  journal= {arXiv preprint arXiv:2506.23418},
  year   = {2025}
}

备注

12 main pages, 18 figures, and 16 tables