中文

地球何处?一个用于探测模型跨尺度地理定位能力的视觉-语言基准

计算机视觉与模式识别 2025-10-14 v1

摘要

视觉-语言模型 (VLM) 发展迅速,但其在开放世界条件下基于图像的地理定位能力——一项具有挑战性且在现实生活中有需求的任务——尚未得到全面评估。我们提出 EarthWhere,一个用于 VLM 图像地理定位的综合基准,评估视觉识别、逐步推理与证据使用。EarthWhere 包含 810 张全球分布的图像,涵盖两个互补的地理定位尺度:WhereCountry(即 500 道选择题,答案为国家级别且为全景图)与 WhereStreet(即 310 个细粒度街道级识别任务,需要多步推理并可使用网络搜索)。在评估方面,我们采用最终预测指标:坐标的 k 公里内位置准确率 (Acc@k) 与文本定位的分层路径分数。除此之外,我们提出使用人工验证的关键视觉线索以及一种对每条线索边际贡献进行归因的 Shapley 加权思考分数,对中间推理链进行显式打分。我们在 EarthWhere 上对 13 个配备网络搜索工具的最先进 VLM 进行了基准测试,并报告了不同类型的最终答案准确率以及校准后的模型思考分数。总体而言,Gemini-2.5-Pro 取得了 56.32% 的最佳平均准确率,而最强的开放权重模型 GLM-4.5V 达到 34.71%。我们揭示了当视觉线索有限时,网络搜索与推理并不能保证性能的提升,且模型存在区域偏差,在某些地区的得分比其他地区高出多达 42.7%。这些发现不仅凸显了模型的前景,也凸显了其在缓解偏差与实现稳健细粒度定位方面持续存在的挑战。我们在 https://github.com/UCSC-VLAA/EarthWhere 开源了我们的基准。

关键词

引用

@article{arxiv.2510.10880,
  title  = {Where on Earth? A Vision-Language Benchmark for Probing Model Geolocation Skills Across Scales},
  author = {Zhaofang Qian and Hardy Chen and Zeyu Wang and Li Zhang and Zijun Wang and Xiaoke Huang and Hui Liu and Xianfeng Tang and Zeyu Zheng and Haoqin Tu and Cihang Xie and Yuyin Zhou},
  journal= {arXiv preprint arXiv:2510.10880},
  year   = {2025}
}