中文

大型多模态模型图画地图理解用于文本化局部地理定位

人工智能 2025-07-14 v1 计算与语言 计算机视觉与模式识别

摘要

数百年来收集的数以百万计的生物样本记录存档在自然历史藏品中且未进行地理标注。对这些收藏样本关联的复杂局部描述进行地理标注是一个高度耗时的任务,而收藏机构常常难以应对。目前现有的自动化方法未能利用地图——这是地理标注复杂关系的重要工具。我们提出了一种新颖方法,利用最近的大型多模态模型(LMM)的多模态能力。该方法使模型能够在阅读局部描述时,对其进行视觉语境化,以理解其中的空间关系。我们采用基于网格的方法,在零样本设置下将这些自回归模型适用于该任务。我们在小规模手动标注数据集上进行的实验表明,与单模态大语言模型和现有地理标注工具相比,我们的方法表现优异(约1公里的平均距离误差)。本文还讨论了在LMM理解细粒度地图能力的意义下,这些实验结果。基于这些结果,我们提出了一个实用框架,用于将该方法集成到地理标注工作流程中。

关键词

引用

@article{arxiv.2507.08575,
  title  = {Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing},
  author = {Kalana Wijegunarathna and Kristin Stock and Christopher B. Jones},
  journal= {arXiv preprint arXiv:2507.08575},
  year   = {2025}
}