中文

LLMGeo:面向野外图像地理定位的大语言模型基准测试

计算机视觉与模式识别 2024-06-03 v1

摘要

图像地理定位是众多图像理解应用中的关键任务。然而,现有方法在分析具有挑战性的野外图像时往往难以胜任。受多模态语言模型异常出色的背景知识启发,我们系统评估了其地理定位能力,采用新构建的图像数据集和全面评估框架。我们首先通过 Google Street View 收集来自多个国家的图像。随后,对闭源和开源多模态语言模型进行训练免费和基于训练的评估。我们的发现表明,闭源模型在地理定位方面表现优异,而通过微调可使开源模型实现相当的性能。

关键词

引用

@article{arxiv.2405.20363,
  title  = {LLMGeo: Benchmarking Large Language Models on Image Geolocation In-the-wild},
  author = {Zhiqiang Wang and Dejia Xu and Rana Muhammad Shahroz Khan and Yanbin Lin and Zhiwen Fan and Xingquan Zhu},
  journal= {arXiv preprint arXiv:2405.20363},
  year   = {2024}
}

备注

7 pages, 3 figures, 5 tables, CVPR 2024 Workshop on Computer Vision in the Wild