中文

隐藏于显而易见之中:评估视觉语言模型中的抽象形状识别

计算机视觉与模式识别 2024-11-12 v1

摘要

尽管形状感知在人类视觉中很重要,但早期神经图像分类器在物体识别中对形状信息的依赖程度低于其他(通常为虚假的)特征。虽然近期研究表明当前大型视觉语言模型(VLM)对形状的依赖程度更高,但我们发现它们在这方面仍然存在严重局限。为了量化此类局限,我们引入了 IllusionBench,一个挑战当前最先进的 VLM 在场景中通过视觉元素的排列来解读形状信息的数据集。我们广泛的评估表明,尽管这些形状对人类标注者来说很容易识别,但当前 VLM 在识别它们方面存在困难,这为开发更鲁棒的视觉感知系统指明了未来研究的重要方向。完整的数据集和代码库可在以下网址获取:\url{https://arshiahemmat.github.io/illusionbench/}

关键词

引用

@article{arxiv.2411.06287,
  title  = {Hidden in Plain Sight: Evaluating Abstract Shape Recognition in Vision-Language Models},
  author = {Arshia Hemmat and Adam Davies and Tom A. Lamb and Jianhao Yuan and Philip Torr and Ashkan Khakzar and Francesco Pinto},
  journal= {arXiv preprint arXiv:2411.06287},
  year   = {2024}
}