中文

GRASP:基于结构化策略学习的地理空间像素推理

计算机视觉与模式识别 2025-10-29 v2

摘要

地理空间像素推理旨在从自然语言指令直接生成遥感影像中的分割掩码。大多数现有方法遵循一种范式,即在密集像素级掩码作为ground truth的监督下微调多模态大语言模型。虽然在训练数据分布内有效,但这种设计存在两个主要缺点:(1)大规模密集掩码标注的高成本,(2)监督微调在域外场景中的有限泛化能力。为此,我们提出GRASP,一种结构化策略学习框架,将多模态大语言模型与预训练分割模型级联集成。为增强泛化性,我们引入PRIME训练范式,用强化学习取代监督微调,以更好地对齐推理和定位行为与任务目标。为减少标注成本,我们设计BoP-Rewards,用边界框和正点取代密集掩码标签。它通过两种互补信号进行输出验证:格式约束推理和定位结构保持可解析语法,准确性评估预测框和点的质量。对于评估,我们在EarthReason和GeoPixInstruct上训练我们的方法和所有基线,构建一个将它们的测试集合并的领域内基准。我们进一步发布GRASP-1k,一个包含推理密集型查询、推理痕迹和细粒度掩码的完全域外基准。实验结果显示领域内最先进(SOTA)性能以及在域外场景中最高可达54%的改进,确认强化学习与成本感知奖励为地理空间像素推理提供了稳健且可扩展的范式。所有代码和数据集将公开发布。

关键词

引用

@article{arxiv.2508.17102,
  title  = {GRASP: Geospatial pixel Reasoning viA Structured Policy learning},
  author = {Chengjie Jiang and Yunqi Zhou and Jiafeng Yan and Jing Li and Jiayang Li and Yue Zhou and Hongjie He and Jonathan Li},
  journal= {arXiv preprint arXiv:2508.17102},
  year   = {2025}
}

备注

15 pages, 9 figures