中文

SpatialLock:文本到图像合成中精确的空间控制

计算机视觉与模式识别 2025-11-07 v1

摘要

文本到图像(Text-to-Image,T2I)合成近年来取得了显著进展,推动了如自动生成数据集等应用。然而,对生成图像中对象局部化的精确控制仍是一个挑战。现有方法未能充分利用位置信息,导致对对象空间布局的理解不足。为此,我们提出了 SpatialLock,一种新型框架,利用感知信号和 grounding 信息,联合控制生成过程中对象的空间位置。SpatialLock 包含两个组件:位置参与注入(Position-Engaged Injection,PoI)和位置引导学习(Position-Guided Learning,PoG)。PoI 通过注意力层直接集成空间信息,鼓励模型有效学习 grounding 信息。PoG 采用基于感知的监督进一步细化对象局部化。通过这两个组件,模型能够生成具有精确空间布局的对象,并提升生成图像的视觉质量。实验表明,SpatialLock 在多个数据集上实现了超过 0.9 的 IOU 分数,为精确对象定位树立了新的状态突破。

关键词

引用

@article{arxiv.2511.04112,
  title  = {SpatialLock: Precise Spatial Control in Text-to-Image Synthesis},
  author = {Biao Liu and Yuanzhi Liang},
  journal= {arXiv preprint arXiv:2511.04112},
  year   = {2025}
}

备注

Work in progress