SpatialGenEval:文本到图像模型空间智力基准
计算机视觉与模式识别
2026-01-30 v2
摘要
文本到图像(T2I)模型在生成高保真图像方面取得了显著进展,但在处理复杂空间关系(如空间感知、推理或交互)时常常失败。由于其简短或信息稀疏的提示设计,当前基准大多忽略了这些关键方面。本文引入SpatialGenEval,一个新的基准,系统评估T2I模型的空间智力,涵盖两个关键方面:(1) SpatialGenEval涉及1,230个较长、信息密集的提示,覆盖25个真实场景。每个提示整合10个空间子领域及相应的10个多选问答对,从对象位置、布局到遮挡和因果关系。我们对21个最先进模型的广泛评估表明,高阶空间推理仍是主要瓶颈。(2) 为证明信息密集设计的实用性超越简单评估,我们还构建了SpatialT2I数据集。它包含15,400个文本-图像对,采用重写提示以确保图像一致性同时保持信息密度。在当前基础模型(Stable Diffusion-XL、Uniworld-V1、OmniGen2)上的微调结果一致获得性能提升(+4.2%、+5.7%、+4.4%),并在空间关系中实现更真实的效果,凸显了数据中心范式以实现T2I模型的空间智力。
引用
@article{arxiv.2601.20354,
title = {Everything in Its Place: Benchmarking Spatial Intelligence of Text-to-Image Models},
author = {Zengbin Wang and Xuecai Hu and Yong Wang and Feng Xiong and Man Zhang and Xiangxiang Chu},
journal= {arXiv preprint arXiv:2601.20354},
year = {2026}
}
备注
Accepted by ICLR 2026, URL: https://github.com/AMAP-ML/SpatialGenEval