GeoLocSFT:通过多模态基础模型监督微调实现高效视觉地理定位
人工智能
2025-06-03 v1
摘要
准确确定单张图像拍摄地点的地理坐标(即视觉地理定位)仍是一项艰巨的挑战,因为地球广袤无垠且相距遥远的地表位置具有欺骗性的相似度。我们引入了 GeoLocSFT,一个展示了使用小型高质量数据集对大型多模态基础模型(Gemma 3)进行针对性监督微调(SFT)即可产生极具竞争力的地理定位性能的框架。GeoLocSFT 仅使用来自我们地理分布多样的 MR600k 数据集中 2700 对精心挑选的图像-GPS 对进行训练。尽管数据有限,我们以 SFT 为核心的方法仍显著优于基线模型,并在 Im2GPS-3k 和 YFCC-4k 等标准基准以及我们新提出的、专门针对人口稀疏区域的 MR40k 挑战性基准上取得了稳健的结果。此外,我们探索了多候选推理与聚合策略,但发现核心增益已在 SFT 阶段实现。我们的发现凸显了高质量监督与高效 SFT 在行星尺度图像地理定位中的威力,尤其是与需要庞大数据库或复杂流程的先前方法相比。为促进进一步研究,我们公开发布了 MR40k 基准数据集。
引用
@article{arxiv.2506.01277,
title = {GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models},
author = {Qiang Yi and Lianlei Shan},
journal= {arXiv preprint arXiv:2506.01277},
year = {2025}
}
备注
29 pages, 14 figures