中文

当视觉语言模型判断时:暴露信息偏差

人工智能 2026-04-21 v1

摘要

视觉语言模型(VLM)作为判官的可靠性对于自动评估视觉语言模型至关重要。尽管近期取得了进展,但我们的分析揭示,VLM作为判官在做出决策时往往仅有限地关注图像。相反,它们往往盲目偏向更具信息性的答案,即使能够识别出该答案与图像内容存在冲突。我们称这种问题为信息偏差(informativeness bias),它显著削弱了判官的可靠性。为解决此问题,我们提出了 BIRCH(Balanced Informativeness and CoRrectness with a Truthful AnCHor)判决范式,该范式首先纠正候选答案与图像内容之间的不一致,然后将答案与此纠正后的版本进行比较。这将判官的注意力从信息性转向图像导向的正确性。在多个模型和基准上的实验表明,BIRCH 将信息偏差降低最高可达 17%,性能提升最高可达 9.8%。我们的工作揭示了当前 VLM 作为判官系统中存在的一种被忽视但根本性的缺陷,并凸显了需要更原则性设计的必要性。

关键词

引用

@article{arxiv.2604.17768,
  title  = {When Vision-Language Models Judge Without Seeing: Exposing Informativeness Bias},
  author = {Xiaohan Zou and Roshan Sridhar and Mohammadtaher Safarzadeh and Dan Roth},
  journal= {arXiv preprint arXiv:2604.17768},
  year   = {2026}
}

备注

Accepted at ACL 2026 Main Conference