中文

使用多模态大语言模型与检索增强生成的街景级地理定位

计算机视觉与模式识别 2025-09-03 v1 人工智能

摘要

从图像中进行街景级地理定位对于广泛的必要应用和服务至关重要,例如导航、基于位置的推荐和城市规划。随着社交媒体数据和智能手机嵌入式摄像头的日益普及,应用传统计算机视觉技术对图像进行定位已变得极具挑战性,但也极具价值。本文引入了一种新颖的方法,将开放权重且公开可访问的多模态大语言模型与检索增强生成相结合。该方法使用 SigLIP 编码器在两个大规模数据集(EMP-16 和 OSV-5M)上构建向量数据库。查询图像在由多模态大语言模型处理之前,会使用从该数据库检索到的包含相似和相异地理位置信息的提示进行增强。我们的方法展示了最先进的性能,与三个广泛使用的基准数据集(IM2GPS、IM2GPS3k 和 YFCC4k)相比实现了更高的准确率。重要的是,我们的解决方案无需昂贵的微调或重新训练,并无缝扩展以纳入新的数据源。本文所展示的基于检索增强生成的多模态大语言模型在地理定位估计中的有效性,为依赖从头训练模型的传统方法提供了一条替代路径,为 GeoAI 中更易获取和可扩展的解决方案开辟了新的可能性。

关键词

引用

@article{arxiv.2509.01341,
  title  = {Street-Level Geolocalization Using Multimodal Large Language Models and Retrieval-Augmented Generation},
  author = {Yunus Serhat Bicakci and Joseph Shingleton and Anahid Basiri},
  journal= {arXiv preprint arXiv:2509.01341},
  year   = {2025}
}