中文

VLM的视力检查:指导与检验视觉语言模型的视觉能力

计算机视觉与模式识别 2024-09-24 v1 人工智能

摘要

视觉语言模型(VLM)在各种基准测试中显示出有前景的推理能力;然而,我们对其视觉感知的理解仍然有限。在这项工作中,我们提出了一个视力检查过程来研究VLM如何感知图像,特别关注视觉识别的关键要素,从原始的颜色和形状到语义层面。为此,我们引入了一个名为LENS的数据集来指导VLM遵循检查并检查其准备情况。一旦模型准备好,我们就进行检查。通过这次检查,我们量化并可视化了VLM对颜色、形状和语义匹配的敏感性。我们的发现表明,VLM对不同颜色具有不同的敏感性,同时在不同VLM中始终表现出对绿色的不敏感性。此外,我们发现,尽管使用相同的固定视觉编码器,但根据LLM的能力不同,形状敏感性和语义识别也不同。我们的分析和发现有可能启发VLM的设计以及VLM视觉输入的预处理,以提高应用性能。

关键词

引用

@article{arxiv.2409.14759,
  title  = {VLM's Eye Examination: Instruct and Inspect Visual Competency of Vision Language Models},
  author = {Nam Hyeon-Woo and Moon Ye-Bin and Wonseok Choi and Lee Hyun and Tae-Hyun Oh},
  journal= {arXiv preprint arXiv:2409.14759},
  year   = {2024}
}