中文

视觉语言因果推理中的抽象差距

计算与语言 2026-05-28 v1 计算机视觉与模式识别

摘要

视觉语言模型(VLMs)生成流畅的因果解释,但当前的评估方法无法区分语言合理性与忠实的因果推理。我们引入一种双探针方法,以隔离这两种属性。文本单项探针测量语言质量。链式文本探针要求模型首先生成明确的因果链。抽象差距(AG)指标衡量规范化性能差异。我们在CAGE(因果抽象差距评估)基准上评估了8个视觉语言模型,该基准包含49,500个问题,涵盖5,500张图像,贯穿Pearl因果层级。我们发现七个模型的AG值超过0.50,文本得分在6--8分,但链式得分低于2.5分。在45,000个链注释示例上的微调未能缩小差距。然而,一个模型实现了接近零的AG。这种能力存在于当前VLMs架构中,取决于预训练和架构选择。CAGE为评估VLMs中忠实因果推理提供了诊断工具。

关键词

引用

@article{arxiv.2605.28779,
  title  = {The Abstraction Gap in Vision-Language Causal Reasoning},
  author = {Chinh Hoang and Mohammad Rashedul Hasan},
  journal= {arXiv preprint arXiv:2605.28779},
  year   = {2026}
}