中文

视觉-语言模型为何失败?面向图像地理定位的世界尺度分析

机器学习 2026-04-20 v1 人工智能

摘要

图像地理定位传统上通过基于检索的地点识别或基于几何的视觉定位管道来实现。近期的视觉-语言模型(VLM)在跨模态任务中展现出强大的零样推理能力,但其在地理推断方面的表现仍未得到充分探索。本文系统评估了多个最先进VLM用于基于地面视图图像的国家级图像地理定位。我们不依赖图像匹配、GPS元数据或任务特定的训练,而是在零样设置下评估基于提示的国家预测。所选模型在三个地理上多样化的数据集上进行测试,以评估其鲁棒性和概括能力。我们的结果显示,不同模型之间存在显著差异,凸显了语义推理在粗糙地理定位方面的潜力,以及当前VLM在捕捉细粒度地理线索方面的局限性。这项研究为现代VLM在多模态推理与地理理解交叉领域的研究提供了首个专注的比较,为未来研究奠定了基础。

关键词

引用

@article{arxiv.2604.16247,
  title  = {Joint-Centric Dual Contrastive Alignment with Structure-Preserving and Information-Balanced Regularization},
  author = {Habibeh Naderi and Behrouz Haji Soleimani and Stan Matwin},
  journal= {arXiv preprint arXiv:2604.16247},
  year   = {2026}
}