中文

感知分类学:评估和引导视觉语言模型中的层次化场景推理

计算机视觉与模式识别 2025-11-26 v1

摘要

我们提出感知分类学(Perceptual Taxonomy),这是一种结构化的场景理解过程,首先识别对象及其空间配置,然后推断用于支持目标导向推理的任务相关属性,如材料、可达性、功能和物理属性。虽然这种推理是人类认知的基本形式,但当前的视觉语言基准缺乏对这种能力的全面评估,仅侧重于表层识别或图像-文本对齐。为弥合这一差距,我们引入感知分类学,一个面向物理驱动的视觉推理基准。我们为 3173 个对象标注四类属性家族,覆盖 84 个细粒度属性。基于这些标注,我们构建了一个包含 5802 张图像的多选问答基准,覆盖合成域和真实域。该基准包含 28033 题基于模板的问题,涵盖四类问题类型(对象描述、空间推理、属性匹配和分类学推理),以及 50 题专家精心挑选的题目,用于全面评估模型在感知分类学推理中的表现。实验结果表明,领先的视觉语言模型在识别任务上表现良好,但在基于属性的问题上性能下降 10%至 20%,尤其是需要对结构化属性进行多步推理的问题。这凸显了结构化视觉理解的持久差距以及依赖模式匹配的当前模型的局限性。我们还表明,提供来自模拟场景的上下文推理示例可提高在真实世界和专家精选问题上的性能,显示示了感知分类学引导的提示的有效性。

关键词

引用

@article{arxiv.2511.19526,
  title  = {Perceptual Taxonomy: Evaluating and Guiding Hierarchical Scene Reasoning in Vision-Language Models},
  author = {Jonathan Lee and Xingrui Wang and Jiawei Peng and Luoxin Ye and Zehan Zheng and Tiezheng Zhang and Tao Wang and Wufei Ma and Siyi Chen and Yu-Cheng Chou and Prakhar Kaushik and Alan Yuille},
  journal= {arXiv preprint arXiv:2511.19526},
  year   = {2025}
}