中文

真实图像,更差判断:评估视觉语言模型在具体性和意象性方面的表现

计算与语言 2026-05-27 v1

摘要

视觉输入常被假设为能提高多模态模型的语言理解能力。我们检验这一假设,探讨视觉语言模型(VLM)在词汇判断中是否能够区分有用的视觉证据与偶然的图像上下文。我们采用人类对具体性和意象性的评级,因为这些评级涵盖了从抽象且低意象词汇到具体且高意象词汇不等的词汇。我们发现,真实图像的上下文并未产生一致的提升,反而常常损害与人类评级的一致性,这种损害在视觉证据最不相关时尤为明显。通过探测性分析和标准相关性分析,并辅以归因案例研究,我们发现,真实图像的上下文与 representational 位移以及对虚假视觉线索的更高敏感性相关,这与针对目标词汇属性的恢复能力较弱相吻合。我们进一步表明,在推断时指示模型仅关注文本内容可以减少这种退化,其中最脆弱子集的提升最为明显。我们的发现表明,当前的指令调优视觉语言模型需要更好的校准,才能判断何时应该利用视觉上下文进行词汇判断。

关键词

引用

@article{arxiv.2605.27315,
  title  = {Real Images, Worse Judgments: Evaluating Vision-Language Models on Concreteness and Imagery},
  author = {Yifan Jiang and Ruoxi Ning and Sheng Yao and Freda Shi},
  journal= {arXiv preprint arXiv:2605.27315},
  year   = {2026}
}