中文

LocationAgent:一种通过解耦策略与参数化知识证据实现图像地理定位的层次化智能体

人工智能 2026-01-28 v1 计算机视觉与模式识别

摘要

图像地理定位旨在根据视觉内容推断拍摄地点。从根本上说,这构成了一个由“假设-验证循环”组成的推理过程,要求模型同时具备地理空间推理能力和根据地理事实验证证据的能力。现有方法通常通过监督训练或基于轨迹的强化微调将位置知识和推理模式内化到静态记忆中。因此,这些方法在开放世界场景或需要动态知识的场景中容易出现事实幻觉和泛化瓶颈。为了解决这些挑战,我们提出了一种层次化定位智能体,称为 LocationAgent。我们的核心理念是在模型内部保留层次化推理逻辑,同时将地理证据的验证卸载到外部工具。为了实现层次化推理,我们设计了 RER 架构(推理器-执行器-记录器),该架构采用角色分离和上下文压缩来防止多步推理中的漂移问题。对于证据验证,我们构建了一套线索探索工具,提供多样化的证据来支持位置推理。此外,为了解决现有数据集中的数据泄露和中文数据稀缺问题,我们引入了 CCL-Bench(中国城市定位基准),这是一个涵盖多种场景粒度和难度级别的图像地理定位基准。大量实验表明,LocationAgent 在零样本设置下显著优于现有方法,性能提升至少 30%。

关键词

引用

@article{arxiv.2601.19155,
  title  = {LocationAgent: A Hierarchical Agent for Image Geolocation via Decoupling Strategy and Evidence from Parametric Knowledge},
  author = {Qiujun Li and Zijin Xiao and Xulin Wang and Zhidan Ma and Cheng Yang and Haifeng Li},
  journal= {arXiv preprint arXiv:2601.19155},
  year   = {2026}
}

备注

9 pages, 5 figures, 3 tables