MapIQ:评估多模态大语言模型进行地图问答能力
计算与语言
2025-10-07 v2 人工智能
计算机视觉与模式识别
机器学习
摘要
近期多模态大语言模型(MLLM)的进展推动了研究者探索这些模型如何阅读数据可视化(如柱状图、散点图等)。更近期,注意力转向针对地图的视觉问答(Map-VQA)。然而,Map-VQA 研究主要聚焦于等值面图,这仅覆盖有限的主题类别和视觉分析任务。为弥补这一差距,我们引入 MapIQ,一个包含 14,706 个问答对的基准数据集,覆盖三种地图类型:等值面图、制图图和比例符号图,涵盖来自六个不同主题(如房地产、犯罪)的问答。我们评估了多个 MLLM 的表现,使用六种视觉分析任务进行比较,并将其性能与人类基准进行对比。此外,一个额外实验检查了地图设计变更(如更改配色方案、修改图例设计以及移除地图元素)对 MLLM 鲁棒性和敏感性、其对地理知识的依赖性,以及改善 Map-VQA 性能的潜在途径的影响。
引用
@article{arxiv.2507.11625,
title = {MapIQ: Evaluating Multimodal Large Language Models for Map Question Answering},
author = {Varun Srivastava and Fan Lei and Srija Mukhopadhyay and Vivek Gupta and Ross Maciejewski},
journal= {arXiv preprint arXiv:2507.11625},
year = {2025}
}
备注
Published as a conference paper at COLM 2025