中文

大型视觉语言模型能像人类一样读图吗?

计算机视觉与模式识别 2025-03-20 v1

摘要

在本文中,我们引入了 MapBench——第一个专门为人类可读的、基于像素的地图户外导航设计的数据集,来源于复杂的路径查找场景。MapBench 包含来自 100 张多样化地图的超过 1600 个像素空间地图路径查找问题。在 MapBench 中,大型视觉语言模型(LVLMs)根据地图图像和包含起点与终点地标的查询生成语言形式的导航指令。对于每张地图,MapBench 提供了地图空间场景图(MSSG)作为索引数据结构,用于在自然语言与地图空间之间进行转换并评估 LVLM 生成的结果。我们证明 MapBench 对最先进的大型视觉语言模型构成了显著挑战,无论是在零样本提示还是在将地图导航分解为连续认知过程的思维链(CoT)增强推理框架下。我们对开源和闭源 LVLMs 的评估强调了 MapBench 带来的巨大困难,揭示了其在空间推理和结构化决策能力方面的关键局限。我们已在 https://github.com/taco-group/MapBench 发布了所有代码和数据集。

关键词

引用

@article{arxiv.2503.14607,
  title  = {Can Large Vision Language Models Read Maps Like a Human?},
  author = {Shuo Xing and Zezhou Sun and Shuangyu Xie and Kaiyuan Chen and Yanjia Huang and Yuping Wang and Jiachen Li and Dezhen Song and Zhengzhong Tu},
  journal= {arXiv preprint arXiv:2503.14607},
  year   = {2025}
}

备注

35 pages