GeoX-Bench:跨视图地理定位与大型多模态模型姿态估计能力基准
计算机视觉与模式识别
2025-11-18 v1 人工智能
摘要
大型多模态模型(LMM)在广泛的任务中展现出惊人的能力,但其在跨视图地理定位和姿态估计领域的知识与能力尚未得到探索,尽管这些能力对于导航、自动驾驶、户外机器人等具有潜在价值。为弥合这一差距,我们引入了 \textbf{GeoX-Bench},一个综合性 \underline{Bench}mark,旨在探索和评估 LMM 在 \underline{cross}-view \underline{Geo}-localization 和姿态估计任务中的能力。具体而言,GeoX-Bench 包含 10,859 组全景-卫星图像对,覆盖 128 个城市,遍及 49 个国家,伴随相应的 755,976 对问答(QA)对。其中 42,900 对 QA 对用于基准测试,其余用于提升 LMM 的能力。基于 GeoX-Bench,我们评估了 25 个最先进 LMM 在跨视图地理定位和姿态估计任务中的能力,并进一步探讨了指令调谐赋予的能力。我们的基准显示,尽管当前 LMM 在地理定位任务中取得了令人印象深刻的性能,但在更复杂的姿态估计任务中的效果显著下降,这凸显了未来改进的关键领域,指令调谐 LMM 在 GeoX-Bench 的训练数据上可显著提升跨视图地理感知能力。GeoX-Bench 可在 \textcolor{magenta}{https://github.com/IntMeGroup/GeoX-Bench} 访问。
引用
@article{arxiv.2511.13259,
title = {GeoX-Bench: Benchmarking Cross-View Geo-Localization and Pose Estimation Capabilities of Large Multimodal Models},
author = {Yushuo Zheng and Jiangyong Ying and Huiyu Duan and Chunyi Li and Zicheng Zhang and Jing Liu and Xiaohong Liu and Guangtao Zhai},
journal= {arXiv preprint arXiv:2511.13259},
year = {2025}
}