中文

何时称苹果为红色:人类遵循内省规则,而视觉语言模型不遵循

计算与语言 2026-04-09 v1 人工智能 计算机视觉与模式识别

摘要

理解视觉语言模型(VLM)何时会表现异常、模型能否可靠地预测自身行为以及模型是否遵循其内省推理,是可信部署的核心挑战。为研究这一问题,我们引入了分级颜色归因(Graded Color Attribution, GCA)数据集,这是一个受控基准,旨在引出决策规则并评估参与者对这些规则的忠实度。GCA由线描图组成,其像素级颜色覆盖在三个条件下变化:世界知识重着色、反事实重着色以及无颜色先验的形状。使用GCA,VLMs和人类参与者均建立了一个阈值:给定颜色的对象必须拥有该颜色像素的最小百分比。我们随后将这些规则与后续的颜色归因决策进行比较。我们的发现表明,模型系统地违反其自身的内省规则。例如,GPT-5-mini在具有强颜色先验的对象上,近60%的情况下违反了其陈述的内省规则。人类参与者忠实于其陈述的规则,任何看似违反的情况均可归因于一种已被充分记录的倾向于高估颜色覆盖的倾向。相比之下,我们发现VLMs是颜色覆盖的优秀估计器,却在最终回答中公然违背其自身推理。在所有模型和用于引出内省规则的策略中,世界知识先验以不反映人类认知的方式系统性地降低忠实度。我们的发现挑战了VLM推理失败是由难度驱动的观点,并表明VLM的内省自知识校准不当,对高风险部署具有直接影响。

关键词

引用

@article{arxiv.2604.06422,
  title  = {When to Call an Apple Red: Humans Follow Introspective Rules, VLMs Don't},
  author = {Jonathan Nemitz and Carsten Eickhoff and Junyi Jessy Li and Kyle Mahowald and Michal Golovanevsky and William Rudman},
  journal= {arXiv preprint arXiv:2604.06422},
  year   = {2026}
}