中文

学习漫游:通过可操作推理提升大型多模态模型的全局图像地理定位能力

计算机视觉与模式识别 2026-03-12 v1

摘要

地理定位是指识别图像地理位置的任务,需要丰富的世界知识和复杂的推理能力。虽然先进的大型多模态模型 (LMM) 已展现出优异的上述能力,但其在地理定位任务上的表现尚未得到探索。为此,我们引入了 **WanderBench**,这是一套首个面向可操作地理定位推理的开放式全球地理定位基准数据集,包含跨六大洲的超过 32K 张全景图,按可导航图组织,可实现旋转和移动等物理动作,将地理定位从静态识别转化为交互式探索。基于此基础,我们提出了 **GeoAoT** (Action of Thought) 框架,即 **Geo**location with **A**ction of **T**hough, 将推理与可操作动作耦合。GeoAoT 生成可操作计划(如靠近地标或调整视角),以主动减少不确定性。我们进一步建立了评估协议,联合衡量地理定位精度和难度感知的地理定位问答能力。在 19 个大型多模态模型上进行实验表明,GeoAoT 在细粒度定位和动态环境下的泛化能力方面均显著优于其他方法。WanderBench 和 GeoAoT 定义了可操作、以推理为驱动的具象化视觉理解中的新范式。

关键词

引用

@article{arxiv.2603.10463,
  title  = {Learning to Wander: Improving the Global Image Geolocation Ability of LMMs via Actionable Reasoning},
  author = {Yushuo Zheng and Huiyu Duan and Zicheng Zhang and Xiaohong Liu and Xiongkuo Min},
  journal= {arXiv preprint arXiv:2603.10463},
  year   = {2026}
}