中文

CoMPaSS:增强文本到图像扩散模型的空间理解

计算机视觉与模式识别 2025-08-26 v2

摘要

文本到图像(T2I)扩散模型擅长生成逼真图像,但往往无法渲染准确的空间关系。我们指出了导致这一常见失败的两个核心问题:1)现有数据集中关于空间关系数据的模糊性,以及 2)当前文本编码器无法准确解释输入描述的空间语义。我们提出了 CoMPaSS,一个增强 T2I 模型空间理解的多功能框架。它首先通过面向空间约束的配对(SCOP)数据引擎解决数据模糊性问题,该引擎通过原则性约束整理出空间准确的训练数据。为了利用这些先验,CoMPaSS 还引入了 Token 编码排序(TENOR)模块,该模块保留了被文本编码器丢失的关键 Token 排序信息,从而强化了提示词的语言结构。在四种流行 T2I 模型(基于 UNet 和 MMDiT)上的大量实验表明,CoMPaSS 在关键空间基准上确立了新的 SOTA,在 VISOR(+98%)、T2I-CompBench Spatial(+67%)和 GenEval Position(+131%)上取得了显著的相对提升。代码可在 https://github.com/blurgyy/CoMPaSS 获取。

关键词

引用

@article{arxiv.2412.13195,
  title  = {CoMPaSS: Enhancing Spatial Understanding in Text-to-Image Diffusion Models},
  author = {Gaoyang Zhang and Bingtao Fu and Qingnan Fan and Qi Zhang and Runxing Liu and Hong Gu and Huaqi Zhang and Xinguo Liu},
  journal= {arXiv preprint arXiv:2412.13195},
  year   = {2025}
}

备注

21 pages, 12 figures. Accepted to ICCV 2025