中文

一幅图值多少字?深入探讨视觉语言模型中的空间推理

计算机视觉与模式识别 2024-11-06 v2 人工智能

摘要

大型语言模型(LLMs)和视觉语言模型(VLMs)在广泛的任务和领域中展现出卓越的性能。尽管如此,空间理解与推理——人类认知的基本组成部分——仍然受到 insufficient 探索。我们提出了 SpatialEval,这是一个覆盖空间推理多种方面的新基准测试,包括关系理解、导航和计数。我们对竞争性语言和视觉语言模型进行了全面评估。我们的发现揭示了几个被忽视的反直觉见解:(1)空间推理提出了重大挑战,其中竞争模型可能跌居随机猜测之下;(2)尽管额外的视觉输入,VLMs 往往表现不佳,甚至不如其 LLM 对手;(3)当文本和视觉信息同时可用时,多模态语言模型若提供足够的文本线索,便不再依赖视觉信息。此外,我们展示了利用视觉与文本之间的冗余性可显著提升模型性能。我们希望本研究能为开发改进空间智能并进一步缩小与人类智力差距的多模态模型提供指导。

关键词

引用

@article{arxiv.2406.14852,
  title  = {Is A Picture Worth A Thousand Words? Delving Into Spatial Reasoning for Vision Language Models},
  author = {Jiayu Wang and Yifei Ming and Zhenmei Shi and Vibhav Vineet and Xin Wang and Yixuan Li and Neel Joshi},
  journal= {arXiv preprint arXiv:2406.14852},
  year   = {2024}
}

备注

Accepted to NeurIPS 2024