基于显式空间约束强制的测试时可控图像生成
计算机视觉与模式识别
2025-01-03 v1
摘要
最近的文本到图像生成倾向于使用各种形式的空间条件,例如遮罩、边界框和关键点。然而,大多数先前的工作需要特定格式的注释来微调原始模型,从而导致较差的测试时通用性。同时,现有的无训练方法仅能处理简化的提示和空间条件。本文提出了一种新颖且通用的测试时可控生成方法,旨在处理自然文本提示和复杂条件。具体而言,我们将空间条件解耦为语义条件和几何条件,然后在图像生成过程中分别强制执行它们的一致性。对于前者,我们致力于弥合语义条件与文本提示之间的差距,以及语义条件与扩散模型注意力图之间的差距。为此,我们提出先完成语义条件相关的提示,然后通过测量注意力图中干扰提示词的统计信息以及与该条件相关的词空间距离来消除其负面影响。为进一步应对复杂的几何条件,我们引入了几何变换模块,其中将在注意力图中识别区域感兴趣部位(Region-of-Interests, RoI),并进一步用于针对几何条件对类别相关的潜在向量进行转换。更重要的是,我们提出了基于扩散的潜在填充方法,以显式移除RoI处的潜在向量的影响,减少生成图像上的伪影。在Coco-stuff数据集上的实验表明,我们的方法在布局一致性评估指标上相较于领先的无训练方法实现了约30%的相对提升。
引用
@article{arxiv.2501.01368,
title = {Test-time Controllable Image Generation by Explicit Spatial Constraint Enforcement},
author = {Z. Zhang and B. Liu and J. Bao and L. Chen and S. Zhu and J. Yu},
journal= {arXiv preprint arXiv:2501.01368},
year = {2025}
}