GeoVLM:利用视觉语言匹配提高自动车地理定位
计算机视觉与模式识别
2025-05-21 v1 机器人学
摘要
Cross-view geo-localisation 通过将地面级图像与来自数据库的带地理坐标的卫星图像进行匹配来识别自动车的粗略地理位置。尽管 cross-view geo-localisation 取得了进展,但仍存在类似外观相似的场景,这使得在找到正确匹配时(作为 top match)仍然具有挑战性。现有方法达到高召回率,但仍未能将正确图像排名为 top match。为此,本文提出了 GeoVLM,一种新方法利用视觉语言模型的 zero-shot 能力,使其能够使用可解释的 cross-view 语言描述进行 cross-view geo-localisation。GeoVLM 是一种可训练的rerank 方法,可提高 cross-view geo-localisation 的最佳匹配准确率。GeoVLM 在标准基准 VIGOR 和 University-1652 上进行评估,也通过引入本文提出的 Cross-View United Kingdom 新基准数据集进行真实驾驶环境测试。本文的结果表明,借助可解释的自然语言描述,GeoVLM 在 cross-view geo-localisation 的检索性能优于现有 state-of-the-art 方法。代码可在 https://github.com/CAV-Research-Lab/GeoVLM 获取。
引用
@article{arxiv.2505.13669,
title = {GeoVLM: Improving Automated Vehicle Geolocalisation Using Vision-Language Matching},
author = {Barkin Dagda and Muhammad Awais and Saber Fallah},
journal= {arXiv preprint arXiv:2505.13669},
year = {2025}
}