中文

painting 胜于思考:文本到图像模型能否为舞台铺垫但不能指挥剧情?

计算机视觉与模式识别 2026-03-03 v3

摘要

文本到图像(T2I)生成旨在合成由文本提示指定的图像,这些提示共同指定必须显示的内容并暗示可推断的内容,从而对应两种核心能力:\textbf{\textit{构图} 和 \textbf{\textit{推理}}。尽管 T2I 模型在构图和推理方面近期取得了进展,现有基准在评估方面仍受限。它们不仅未能在构图和推理的广度和深度上提供全面覆盖,而且大大限制了评估在低场景密度和简单一对一推理方面的范围。为克服这些限制,我们提出了 \textbf{\textsc{T2I-CoReBench}},一个全面且具有挑战性的基准,用于评估 T2I 模型的构图和推理能力。为确保全面性,我们将构图结构围绕场景图元素(\textit{实例}、\textit{属性} 和 \textit{关系})展开,将推理围绕推理哲学框架(\textit{演绎}、\textit{归纳} 和 \textit{归谬})展开,形成 12 维评估分类学。为提高复杂度,基于固有的现实世界复杂性,我们为每个提示构建更高的构图密度以满足构图要求,并增加推理强度以满足推理要求。为便于细致可靠的评估,我们还为每个评估提示配对一个清单,指定用于独立评估每个预期元素的 \textit{是/否}问题。统计数据方面,我们的基准包含 1,080 个具有挑战性的提示以及约 13,500 个清单问题。38 个当前 T2I 模型的实验结果表明,其构图能力在高构图情景中仍受限,而推理能力在后续跟进,所有模型在从提示中推断隐式元素方面都受到挑战。

关键词

引用

@article{arxiv.2509.03516,
  title  = {Easier Painting Than Thinking: Can Text-to-Image Models Set the Stage, but Not Direct the Play?},
  author = {Ouxiang Li and Yuan Wang and Xinting Hu and Huijuan Huang and Rui Chen and Jiarong Ou and Xin Tao and Pengfei Wan and Xiaojuan Qi and Fuli Feng},
  journal= {arXiv preprint arXiv:2509.03516},
  year   = {2026}
}

备注

Accepted to ICLR 2026. Project Page: https://t2i-corebench.github.io/