基于对齐引导的得分匹配:扩散模型中文本-图像对齐
机器学习
2026-05-29 v1 人工智能
计算机视觉与模式识别
摘要
扩散模型能够生成高度逼真的图像,但在精确的文本-图像对齐方面常常走弯路。虽然近期的后训练方法通过外部奖励或人类偏好信号来提高对齐性能,但其效果严重依赖于奖励质量,且未能直接解决扩散过程中对齐问题。近期的无奖励方法如 SoftREPA 表明,通过对比学习优化软文本标记可有效提升文本-图像表征对齐,优于标准的参数高效微调基线方法。然而,对比形式会对负样本过度惩罚,导致典型失效情况,如计数过度和重复。为此,我们提出一种轻量级、无奖励的后训练方法,通过将对齐引导直接集成到扩散模型的得分匹配目标中,以分配得分层面的对齐方向来细化软标记。我们的 approach 缓解了这些局限性,生成的图像更具连贯性和语义忠实性。实验表明,我们的方法在 GenEval 基准测试中实现了与 SoftREPA 相当的性能,同时显著改善了其失效情况,使计数准确率提升超过 35%。该方法可无缝应用于现有扩散模型主干(SD1.5、SDXL 和 SD3),且与现有的基于强化学习的扩散后训练方法兼容。项目页面:https://jaayeon.github.io/AGSM
引用
@article{arxiv.2605.30038,
title = {Alignment-Guided Score Matching for Text-to-Image Alignment in Diffusion Models},
author = {Jaa-Yeon Lee and Yeobin Hong and Taesung Kwon and Jong Chul Ye},
journal= {arXiv preprint arXiv:2605.30038},
year = {2026}
}
备注
ICML 2026, Project page: https://jaayeon.github.io/AGSM