中文

SAGA:用于改进文本到图像生成的学习信号对齐分布

计算机视觉与模式识别 2026-01-21 v2

摘要

最先进的文本到图像模型虽然产生视觉上令人印象深刻的结果,但常常在与文本提示保持精确对齐方面存在困难,导致关键元素缺失或不同概念意外混合。我们提出了一种新方法,通过学习以目标提示为条件的高成功率分布,确保生成的图像忠实地反映相应的提示。我们的方法在去噪过程中显式建模信号分量,提供细粒度的控制,从而缓解过度优化和超出分布的伪影。此外,我们的框架无需训练,可无缝集成到现有的扩散和流匹配架构中。它还支持额外的条件模块——例如边界框——以实现更精确的空间对齐。广泛的实验表明,我们的方法在当前最先进方法之上。代码已公开于 https://github.com/grimalPaul/gsn-factory。

关键词

引用

@article{arxiv.2508.13866,
  title  = {SAGA: Learning Signal-Aligned Distributions for Improved Text-to-Image Generation},
  author = {Paul Grimal and Michaël Soumm and Hervé Le Borgne and Olivier Ferret and Akihiro Sugimoto},
  journal= {arXiv preprint arXiv:2508.13866},
  year   = {2026}
}

备注

Accepted to AAAI 2026