LLMGeo:面向野外图像地理定位的大语言模型基准测试
计算机视觉与模式识别
2024-06-03 v1
摘要
图像地理定位是众多图像理解应用中的关键任务。然而,现有方法在分析具有挑战性的野外图像时往往难以胜任。受多模态语言模型异常出色的背景知识启发,我们系统评估了其地理定位能力,采用新构建的图像数据集和全面评估框架。我们首先通过 Google Street View 收集来自多个国家的图像。随后,对闭源和开源多模态语言模型进行训练免费和基于训练的评估。我们的发现表明,闭源模型在地理定位方面表现优异,而通过微调可使开源模型实现相当的性能。
引用
@article{arxiv.2405.20363,
title = {LLMGeo: Benchmarking Large Language Models on Image Geolocation In-the-wild},
author = {Zhiqiang Wang and Dejia Xu and Rana Muhammad Shahroz Khan and Yanbin Lin and Zhiwen Fan and Xingquan Zhu},
journal= {arXiv preprint arXiv:2405.20363},
year = {2024}
}
备注
7 pages, 3 figures, 5 tables, CVPR 2024 Workshop on Computer Vision in the Wild