SpatialBench-UC:文本到图像生成中空间提示遵循的不确定性感知评估
人工智能
2026-01-21 v1
摘要
评估文本到图像模型是否遵循显式空间指令难以自动化。目标检测器可能会漏掉目标或返回多个合理的检测结果,而简单的几何测试在边界情况下可能变得模糊。空间评估自然是一个选择性预测问题,检查器可以在证据不足时弃权并报告置信度,以便结果可以被解释为风险覆盖权衡,而不是单一分数。我们引入了 SpatialBench-UC,一个用于成对空间关系的小型、可复现的基准。该基准包含 200 个提示(50 个物体对乘以 4 种关系),分为 100 个通过交换物体角色获得的反事实对。我们发布了基准包、版本化提示、固定配置、每样本检查器输出和报告表,实现了跨模型的可复现和可审计比较。我们还包含了一次轻量级人工审计,用于校准检查器的弃权边界和置信度阈值。我们评估了三个基线:Stable Diffusion 1.5、SD 1.5 BoxDiff 和 SD 1.4 GLIGEN。检查器报告通过率和覆盖率,以及在已决策样本上的条件通过率。结果表明,grounding 方法显著提高了通过率和覆盖率,而由于主要是漏检,弃权仍然是一个主导因素。
引用
@article{arxiv.2601.13462,
title = {SpatialBench-UC: Uncertainty-Aware Evaluation of Spatial Prompt Following in Text-to-Image Generation},
author = {Amine Rostane},
journal= {arXiv preprint arXiv:2601.13462},
year = {2026}
}
备注
19 pages, includes figures and tables