超越噪声:将提示与扩散模型中的潜在表示对齐
计算机视觉与模式识别
2025-12-10 v1
摘要
条件扩散模型依赖于语言到图像的对齐方法来引导生成符合语义准确的输出。尽管该架构取得了成功,但仍存在误对齐和幻觉问题,需自动化的误对齐检测工具来改善质量,例如在最佳- N (BoN) 后生成设置中应用。不幸,生成后测量对齐成本高昂,因为必须等待整体生成完成才能确定提示遵循情况。相反,本文假设文本/图像误对齐可以在去噪过程的早期被检测,从而在无需等待完整生成的情况下实现实时对齐评估。具体而言,我们提出了 NoisyCLIP 方法,在噪声潜在空间中度量语义对齐。本文首次探索并基准测试了在扩散逆过程中的提示到潜在误对齐检测,使用双编码器。我们对 NoisyCLIP 进行定性和定量评估,发现其在 BoN 设置下将计算成本降低 50%,同时达到 98% 的 CLIP 对齐性能。这一方法使能够在生成过程中进行实时对齐评估,在不牺牲语义忠实度的前提下降低成本。
引用
@article{arxiv.2512.08505,
title = {Beyond the Noise: Aligning Prompts with Latent Representations in Diffusion Models},
author = {Vasco Ramos and Regev Cohen and Idan Szpektor and Joao Magalhaes},
journal= {arXiv preprint arXiv:2512.08505},
year = {2025}
}