GeoToken:基于下一词预测的图像层次化地理定位
计算机视觉与模式识别
2025-11-04 v1 人工智能
机器学习
摘要
图像地理定位是确定图像地理来源的任务,面临诸多挑战,主要源于不同地点之间的视觉相似性以及巨大的搜索空间。为此,我们提出一种受人类从宽广地区逐步缩小定位范围启发的层次化序列预测方法。类比地,我们的模型在层次化方式下预测地理标记,首先识别一般地区,然后依序细化预测以获得越来越精确的定位。与依赖显式语义分区不同,我们的方法使用S2细胞——一种嵌套的多分辨率全球网格——并依据视觉输入和前述预测条件顺序预测更细级别的细胞。这一程序类似于大型语言模型中的自回归文本生成。就语言建模而言,最终性能不仅取决于训练,还取决于推理时的策略。我们调查了多种自上而下的遍历方法,用于自回归采样,集成了来自语言模型中测试时计算扩展技术的技术。具体而言,我们集成了束搜索和多采样推理,同时探索各种选择策略以确定最终输出。这使模型能够通过层次结构中多个可能路径来管理不确定性。我们在Im2GPS3k和YFCC4k数据集上对方法进行评估,针对两种不同的基线集合进行比较:一种不使用多模态大语言模型(MLLM)的方法,另一种利用MLLM的方法。在不使用MLLM的setting下,我们的模型在 nearly all 指标上超过其他可比基线,实现了最高可达13.9%的准确率提升。当辅以MLLM后,我们的模型在所有指标上均超越所有基线,达成全新SOTA。源代码可在 https://github.com/NNargesNN/GeoToken 查阅。
引用
@article{arxiv.2511.01082,
title = {GeoToken: Hierarchical Geolocalization of Images via Next Token Prediction},
author = {Narges Ghasemi and Amir Ziashahabi and Salman Avestimehr and Cyrus Shahabi},
journal= {arXiv preprint arXiv:2511.01082},
year = {2025}
}
备注
Accepted to IEEE International Conference on Data Mining (ICDM) 2025