GTPred: 面向可解释地理定位与拍摄时间预测的 MLLM 基准测试
计算机视觉与模式识别
2026-01-21 v1
摘要
地理定位旨在利用可观察的视觉证据推断图像拍摄时的地理位置。传统方法通过在海量图像语料库上进行大规模训练取得了令人瞩目的结果。随着多模态大型语言模型(MLLM)的出现,近期研究探索了其在地理定位中的应用,受益于准确性和可解释性的提升。然而,现有的基准测试很大程度上忽略了图像中固有的时间信息,而这些信息可进一步约束位置。为了弥补这一空白,我们引入了 GTPred,一个用于地理时间预测的新型基准测试。GTPred 包含 370 张全球分布的图像,时间跨度超过 120 年。我们通过联合考虑年份与分层位置序列匹配来评估 MLLM 的预测,并进一步使用精心标注的真值推理过程评估中间推理链。在 8 个专有模型和 7 个开源 MLLM 上的实验表明,尽管具有强大的视觉感知能力,当前模型在世界知识和地理时间推理方面仍然受限。结果还表明,结合时间信息可显著提升位置推断性能。
引用
@article{arxiv.2601.13207,
title = {GTPred: Benchmarking MLLMs for Interpretable Geo-localization and Time-of-capture Prediction},
author = {Jinnao Li and Zijian Chen and Tingzhu Chen and Changbo Wang},
journal= {arXiv preprint arXiv:2601.13207},
year = {2026}
}