将生成器转化为检索器:解锁多模态大语言模型用于自然语言引导的地理位置定位
计算机视觉与模式识别
2026-04-14 v1 人工智能
摘要
自然语言引导的跨视图地理定位(NGCG)旨在使用地面场景的文本描述检索带地理标签的卫星图像。虽然近期的 NGCG 方法常依赖于 CLIP 风格的双编码器架构,但往往 suffer from 跨模态泛化较弱且需要复杂的架构设计。相比之下,多模态大语言模型(MLLM)拥有强大的语义推理能力,但并未直接针对检索任务进行优化。本文提出一种简单而有效的框架,通过参数高效微调来适配 MLLM 以实现 NGCG。我们的 approach 在保持预训练多模态知识的前提下,对 MLLM 中的潜在表示进行优化,实现强大的跨模态对齐,而无需重新设计模型架构。通过对多样变量(从模型骨干网络到特征聚合)进行系统性分析,我们为在 NGCG 中利用 MLLM 提供了实用且通用的见解。我们的 method 在 GeoText-1652 上实现 SOTA,Text-to-Image Recall@1 提升 12.2%,并在 CVG-Text 的 12 个子任务中取得前五名,同时以更少的可训练参数超越基线。这些结果将 MLLM 定位为语义跨视图检索的稳健基础,为 MLLM-based NGCG 作为传统双编码器设计的可扩展且强大的替代方案铺平了道路。项目页面和代码均可在 https://yuqichen888.github.io/NGCG-MLLMs-web/ 访问。
引用
@article{arxiv.2604.10721,
title = {Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization},
author = {Yuqi Chen and Xiaohan Zhang and Ahmad Arrabi and Waqas Sultani and Chen Chen and Safwan Wshah},
journal= {arXiv preprint arXiv:2604.10721},
year = {2026}
}
备注
CVPRF