通过动态空间引导和多路径修剪实现训练-free 目标-背景组合文本到图像
计算机视觉与模式识别
2026-04-14 v1
摘要
现有的文本到图像扩散模型虽在主体合成方面表现出色,但存在持续的前景偏差,将背景视为被动且未被优化的副产品。这种不平衡损害了全局场景的一致性,并限制了组合控制。为解决这一限制,我们提出了一个无需训练的框架,通过重新结构化扩散采样来显式考虑前景-背景相互作用。我们的方法由两个关键组件构成。首先,动态空间引导引入一种软、随时间步变化的门控机制,以在扩散过程中调制前景和背景注意力,从而实现空间平衡的生成。其次,多路径修剪执行多路径潜在探索,并动态筛选候选轨迹,利用内部注意力统计信息和外部语义对齐信号,保留更能满足目标-背景约束的轨迹。我们进一步开发了一个专为评估目标-背景组合性而设计的基准。广泛的评估表明,跨越多个扩散模型主干,本方法在背景连贯性和目标-背景组合对齐方面 consistently 获得改进。
引用
@article{arxiv.2604.09850,
title = {Training-Free Object-Background Compositional T2I via Dynamic Spatial Guidance and Multi-Path Pruning},
author = {Yang Deng and David Mould and Paul L. Rosin and Yu-Kun Lai},
journal= {arXiv preprint arXiv:2604.09850},
year = {2026}
}