中文

视觉语言模型是盲目的:在细节视觉特征翻译为词语方面的失败

人工智能 2025-03-28 v6 计算机视觉与模式识别

摘要

虽然大型语言模型具备视觉能力(VLMs),如GPT-4o和Gemini 1.5 Pro,在许多视觉理解基准测试中得分很高,但在处理低层次视觉任务方面仍存在困难,这些任务对人类而言很简单。具体而言,在BlindTest这套7项非常简单的任务中,包括(a)判断两个圆是否重叠;(b)计算两条线相交次数;(c)判断哪个字母被圆框括起;以及(d)计算Olympic标志中圆的数量,四个最先进的VLMs平均准确率仅为58.07%。Claude 3.5 Sonnet表现最佳,准确率为77.84%,远低于人类预期的100%准确率。在不同的图像分辨率和线宽下,VLMs包括慢思考模型在内持续 struggle with those需要精确空间信息的任务,当几何原语重叠或靠近时。然而,当在形状和字母之间添加大量空间分离时,VLMs表现出接近100%的准确率。线性探针实验表明,视觉编码器包含足够的视觉信息可解决BlindTest,而语言模型未能将其解码为正确答案。代码和数据地址:https://vlmsareblind.github.io

关键词

引用

@article{arxiv.2407.06581,
  title  = {Vision language models are blind: Failing to translate detailed visual features into words},
  author = {Pooyan Rahmanzadehgervi and Logan Bolton and Mohammad Reza Taesiri and Anh Totti Nguyen},
  journal= {arXiv preprint arXiv:2407.06581},
  year   = {2025}
}