中文

生成式模型中隐式世界知识推理基准——Beyond Words and Pixels

计算机视觉与模式识别 2025-12-12 v3 人工智能

摘要

当今文本到图像(T2I)模型能够生成逼真且遵循指令的图像,但仍频繁在需要隐式世界知识的提示上失败。现有评估协议要么侧重构图对齐,要么依赖单轮VQA评分,严重缺乏对知识 grounding、多物理相互作用和可审计证据等关键维度的测试。为此,我们引入PicWorld,首个全面评估T2I模型掌握隐式世界知识和物理因果推理的基准。该基准涵盖1,100个提示,分为三个核心类别。为实现细粒度评估,我们提出PW-Agent,一种基于证据 grounding 的多智能体评估器,通过分解提示中的可验证视觉证据来分层评估图像在物理现实性和逻辑一致性方面的表现。我们对17个主流T2I模型在PicWorld上的全面分析表明,它们普遍存在一定程度的隐式世界知识和物理因果推理能力局限。研究发现,未来的T2I系统需要发展具备推理能力并集成知识的体系结构。

关键词

引用

@article{arxiv.2511.18271,
  title  = {Beyond Words and Pixels: A Benchmark for Implicit World Knowledge Reasoning in Generative Models},
  author = {Tianyang Han and Junhao Su and Junjie Hu and Peizhen Yang and Hengyu Shi and Junfeng Luo and Jialin Gao},
  journal= {arXiv preprint arXiv:2511.18271},
  year   = {2025}
}