中文

FRIEDA:面向视觉语言模型的多步骤制图推理基准测试

计算机视觉与模式识别 2026-03-02 v2 人工智能

摘要

制图推理是通过对齐图例、图尺、罗盘方向、图文本和几何形状跨一个或多个地图图像的空间关系进行解释的技能。虽然作为具体的认知能力和对灾害响应、城市规划等关键任务至关重要,但仍大多未被评估。基于图表和信息图理解方面的进展,近期的大型视觉语言模型研究常将地图视为图表的特殊情况。在 contrast,地图 VQA 需要理解图层化符号学(如符号、几何形状和文本标签)以及与方向和距离相关的空间关系,这些关系常跨越多个地图,且未被图表风格评估所捕获。为填补这一差距,我们引入 FRIEDA,一个用于测试 LVLMs 中复杂开放式制图推理的基准。FRIEDA 来源于各类文档和报告中的真实地图图像,涵盖不同领域和地理区域。遵循地理信息系统 (GIS) 文献中的分类,FRIEDA 覆盖三类空间关系:拓扑关系(边界、等于、相交、包含)、度量关系(距离)和方向关系(方向)。所有问题都需要多步骤推理,许多问题还需要跨图 grounding 与推理。在两个设置下评估十一款最先进的 LVLMs:(1) 直接设置,我们提供与问题相关的地图;(2) 上下文设置,模型可能需要在推理前识别问题相关的地图。即使是最强的模型 Gemini-2.5-Pro 和 GPT-5-Think 也仅达到 38.20% 和 37.20% 的准确率,远低于人类水平的 84.87%。这些结果揭示了多步骤制图推理中的持久差距,使 FRIEDA 成为推动 LVLMs 空间智能发展进步的严格基准。

关键词

引用

@article{arxiv.2512.08016,
  title  = {FRIEDA: Benchmarking Multi-Step Cartographic Reasoning in Vision-Language Models},
  author = {Jiyoon Pyo and Yuankun Jiao and Dongwon Jung and Zekun Li and Leeje Jang and Sofia Kirsanova and Jina Kim and Yijun Lin and Qin Liu and Junyi Xie and Hadi Askari and Nan Xu and Muhao Chen and Yao-Yi Chiang},
  journal= {arXiv preprint arXiv:2512.08016},
  year   = {2026}
}

备注

Accepted to ICLR 2026