中文

GeoReason: 通过逻辑一致性强化学习对齐思考与回答——面向遥感视觉语言模型

计算机视觉与模式识别 2026-01-09 v2

摘要

遥感视觉语言模型 (RS-VLMs) 的演进强调从感知导向的识别转向高层次演绎推理,以增强复杂空间任务中的认知可靠性。然而,当前模型常因逻辑幻觉而受限,即即使得出正确答案也可能基于错误的推理链或依赖位置捷径而非空间逻辑。这一解耦现象削弱了在战略空间决策中的可靠性。为此,我们提出 GeoReason 框架,以同步内部思考与最终决策。我们首先构建 GeoReason-Bench,包含 4000 条由几何原语和专家知识综合而成的推理轨迹。随后,我们提出两阶段训练策略:(1) 监督知识初始化以赋予模型推理语法和领域expertise;(2) 一致性感知强化学习以细化演绎可靠性。第二阶段集成了 novel Logical Consistency Reward,通过 option permutation 策略对逻辑漂移进行惩罚,以将决策锚定在可验证的推理轨迹上。实验结果表明,我们的方法显著提升了 RS-VLMs 的认知可靠性和可解释性,实现了与其他先进方法相比的 state-of-the-art 性能。

关键词

引用

@article{arxiv.2601.04118,
  title  = {GeoReason: Aligning Thinking And Answering In Remote Sensing Vision-Language Models Via Logical Consistency Reinforcement Learning},
  author = {Wenshuai Li and Xiantai Xiang and Zixiao Wen and Guangyao Zhou and Ben Niu and Feng Wang and Lijia Huang and Qiantong Wang and Yuxin Hu},
  journal= {arXiv preprint arXiv:2601.04118},
  year   = {2026}
}