InfSplign:文本到图像扩散模型的推理时空空间对齐
计算机视觉与模式识别
2025-12-30 v2 人工智能
摘要
文本到图像(T2I)扩散模型生成高质量图像,但常常无法捕获文本提示中指定的空间关系。这种限制可追溯到两个因素:训练数据中缺乏细粒度空间监督,以及文本嵌入无法编码空间语义。我们提出 InfSplign,一种训练自由的推理时方法,通过在每个去噪步骤中通过复合损失调整噪声来提高空间对齐。所提损失利用来自 backbone 解码器提取的不同层次的 cross-attention 图,以强执行准确的对象放置和平衡的对象存在。该方法轻量级、即插即用,且与任何扩散 backbone 兼容。我们的全面评估在 VISOR 和 T2I-CompBench 上显示,InfSplign 在已知情况下实现了新的 state-of-the-art(据我们所知),在最强大的推理时基准之上实现了显著的性能提升,甚至超过了微调-based 方法。代码已在 GitHub 上提供。
引用
@article{arxiv.2512.17851,
title = {InfSplign: Inference-Time Spatial Alignment of Text-to-Image Diffusion Models},
author = {Sarah Rastegar and Violeta Chatalbasheva and Sieger Falkena and Anuj Singh and Yanbo Wang and Tejas Gokhale and Hamid Palangi and Hadi Jamali-Rad},
journal= {arXiv preprint arXiv:2512.17851},
year = {2025}
}