中文

MAPWise:评估视觉-语言模型的高级地图查询能力

计算机视觉与模式识别 2024-09-04 v1 人工智能 计算与语言 图形学 人机交互

摘要

视觉-语言模型 (VLM) 在需要联合理解视觉和语言信息的任务中表现出色。这些模型一个特别有前景但尚未被充分探索的应用在于基于各种地图回答问题。本研究调查了 VLM 在基于分区统计地图回答问题方面的效能,这类地图广泛用于数据分析和表示。为了促进和鼓励该领域的研究,我们引入了一个新颖的基于地图的问答基准,包含来自三个地理区域(美国、印度、中国)的地图,每个区域包含 1000 个问题。我们的基准整合了 43 种多样化的问题模板,要求对相对空间关系、复杂的地图特征和复杂的推理有细致入微的理解。它还包括具有离散值和连续值的地图,涵盖了色彩映射、类别排序和样式模式的变化,从而能够进行全面分析。我们在此基准上评估了多个 VLM 的性能,揭示了它们能力上的差距,并为改进此类模型提供了见解。

关键词

引用

@article{arxiv.2409.00255,
  title  = {MAPWise: Evaluating Vision-Language Models for Advanced Map Queries},
  author = {Srija Mukhopadhyay and Abhishek Rajgaria and Prerana Khatiwada and Vivek Gupta and Dan Roth},
  journal= {arXiv preprint arXiv:2409.00255},
  year   = {2024}
}

备注

30 Pages, 46 Tables, 6 Figure