SAGA:用于改进文本到图像生成的学习信号对齐分布
计算机视觉与模式识别
2026-01-21 v2
摘要
最先进的文本到图像模型虽然产生视觉上令人印象深刻的结果,但常常在与文本提示保持精确对齐方面存在困难,导致关键元素缺失或不同概念意外混合。我们提出了一种新方法,通过学习以目标提示为条件的高成功率分布,确保生成的图像忠实地反映相应的提示。我们的方法在去噪过程中显式建模信号分量,提供细粒度的控制,从而缓解过度优化和超出分布的伪影。此外,我们的框架无需训练,可无缝集成到现有的扩散和流匹配架构中。它还支持额外的条件模块——例如边界框——以实现更精确的空间对齐。广泛的实验表明,我们的方法在当前最先进方法之上。代码已公开于 https://github.com/grimalPaul/gsn-factory。
引用
@article{arxiv.2508.13866,
title = {SAGA: Learning Signal-Aligned Distributions for Improved Text-to-Image Generation},
author = {Paul Grimal and Michaël Soumm and Hervé Le Borgne and Olivier Ferret and Akihiro Sugimoto},
journal= {arXiv preprint arXiv:2508.13866},
year = {2026}
}
备注
Accepted to AAAI 2026