通过重新定位注意力图实现空间传输优化:用于无训练文本到图像合成
计算机视觉与模式识别
2025-03-31 v1
摘要
扩散-based文本到图像 (T2I) 模型最近在高质量图像生成方面取得了优异成绩,尤其是在无训练的方式下,使其能够在 diverse 任务中实现成本效益的适应性和泛化。然而,虽然现有方法不断关注诸多挑战,如“缺失物体”和“属性不匹配”,但另一个关键问题“物体位置不准”仍然存在,即生成的空间位置未与文本提示对齐。令人惊讶的是,在流行的 T2I 模型中,确保这一看似基本功能仍然具有挑战性,原因在于通过文本形式施加显式空间指导本身就十分困难。为此,我们提出了 STORM (Spatial Transport Optimization by Repositioning Attention Map),一种新的无训练方法,用于空间一致的 T2I 合成。STORM 采用空间传输优化 (STO),该方法根植于最优传输理论,用于动态调整对象注意力图,以实现精确的空间对齐,并通过空间传输 (ST) 成本函数增强空间理解。我们的分析表明,在早期去噪阶段集成空间感知最为有效,而后期阶段则细化细节。大量实验表明,STORM 超过了现有方法,有效缓解了位置不准的问题,同时改善了缺失和不匹配的属性,为 T2I 合成中的空间对齐树立了新基准。
引用
@article{arxiv.2503.22168,
title = {Spatial Transport Optimization by Repositioning Attention Map for Training-Free Text-to-Image Synthesis},
author = {Woojung Han and Yeonkyung Lee and Chanyoung Kim and Kwanghyun Park and Seong Jae Hwang},
journal= {arXiv preprint arXiv:2503.22168},
year = {2025}
}
备注
CVPR2025