噪声扩散增强文本到图像合成中的语义忠实性
计算机视觉与模式识别
2025-10-28 v2
摘要
扩散模型在生成逼真图像方面取得了显著进展,但在确保与输入提示语之间的精确语义对齐方面仍面临挑战。优化初始噪声潜变量是一种更高效的替代方案,无需修改模型架构或提示工程即可提升语义对齐。最新的方法InitNo通过利用注意力图来细化初始噪声潜变量;然而,这些图仅捕获有限信息,且InitNo的效果高度依赖于初始起点,因为它倾向于在该点附近收敛于局部最优。为此,本文提出利用大型视觉语言模型(LVLMs)的语言理解能力来指导初始噪声潜变量的优化,引入噪声扩散过程,该过程在保持分布一致性的同时更新噪声潜变量,以生成语义忠实的图像。此外,我们对更新改善语义忠实性的条件进行了理论分析。实验结果表明,我们的框架在各种扩散模型中均有效且具有适应性,持续增强语义对齐。代码已公开于 https://github.com/Bomingmiao/NoiseDiffusion。
引用
@article{arxiv.2411.16503,
title = {Noise Diffusion for Enhancing Semantic Faithfulness in Text-to-Image Synthesis},
author = {Boming Miao and Chunxiao Li and Xiaoxiao Wang and Andi Zhang and Rui Sun and Zizhe Wang and Yao Zhu},
journal= {arXiv preprint arXiv:2411.16503},
year = {2025}
}
备注
Updated author formatting; no substantive changes