Geo-R1:通过强化微调改进少样本地理空间指代表达理解
计算机视觉与模式识别
2026-04-24 v3 人工智能
摘要
遥感中的指代表达理解提出了独特的挑战,因为它需要对复杂的对象-上下文关系进行推理。虽然多模态大语言模型上的监督微调(SFT)在拥有大量标注数据集时取得了强劲性能,但在数据稀缺场景下表现挣扎,导致泛化能力差。为解决这一局限性,我们提出了 Geo-R1,一种面向少样本地理空间指代的以推理为中心的强化微调(RFT)范式。Geo-R1 强制模型首先生成显式、可解释的推理链来分解指代表达,然后利用这些依据来定位目标对象。这种“先推理,后行动”的过程使模型能够更有效地利用有限的标注,增强泛化能力,并提供可解释性。我们在三个精心设计的少样本地理空间指代基准上验证了 Geo-R1,我们的模型持续且显著地优于 SFT 基线。它还展现出强大的跨数据集泛化能力,突出了其鲁棒性。代码和数据将发布于:https://github.com/Geo-R1/geo-r1。
引用
@article{arxiv.2509.21976,
title = {Geo-R1: Improving Few-Shot Geospatial Referring Expression Understanding with Reinforcement Fine-Tuning},
author = {Zilun Zhang and Zian Guan and Tiancheng Zhao and Haozhan Shen and Tianyu Li and Yuxiang Cai and Zhonggen Su and Zhaojun Liu and Jianwei Yin and Xiang Li},
journal= {arXiv preprint arXiv:2509.21976},
year = {2026}
}
备注
Accepted by ISPRS