中文

HierLoc:用于层次化视觉地理定位的超球体实体嵌入

计算机视觉与模式识别 2026-03-03 v2 人工智能

摘要

视觉地理定位,即预测图像拍摄位置的任务,由于全球尺度、视觉模糊以及地理本质层次结构而具有挑战性。现有的范式依赖于大规模检索,这需要存储大量图像嵌入,或基于网格的分类器忽略地理连续性,或生成式模型在空间上扩散但在细节方面受限。我们引入一种以实体为中心的地理定位表述,将图像到图像的检索替换为嵌入在超球体空间中的地理实体层次结构。通过 Geo-Weighted Hyperbolic 对比学习,直接将图像对齐到国家、地区、子地区和城市实体,通过将 haversine 距离直接纳入对比目标来实现。这种层次化设计实现了可解释的预测和高效推理,仅需 24 万个实体嵌入即可取代 OSV5M 基准上超过 500 万个图像嵌入。在该基准上,我们的方法实现了新的最佳性能。与文献中当前方法相比,它将平均测地误差降低了 19.5\%,同时将细粒度子地区准确率提升了 43\%。这些结果表明,几何感知的层次化嵌入为全球图像地理定位提供了可扩展且概念上新颖的替代方案。

关键词

引用

@article{arxiv.2601.23064,
  title  = {HierLoc: Hyperbolic Entity Embeddings for Hierarchical Visual Geolocation},
  author = {Hari Krishna Gadi and Daniel Matos and Hongyi Luo and Lu Liu and Yongliang Wang and Yanfeng Zhang and Liqiu Meng},
  journal= {arXiv preprint arXiv:2601.23064},
  year   = {2026}
}

备注

This is camera ready version of the paper accepted to ICLR 2026 (poster)