中文

文本先于视觉:面向超高分辨率遥感理解的智能体 RLVR 中的分阶段知识注入至关重要

人工智能 2026-02-17 v1

摘要

超高分辨率(UHR)遥感(RS)的多模态推理通常受制于视觉证据获取:模型需要在海量像素空间中局部化小型任务相关区域。虽然使用缩放工具的智能体强化学习可验证奖励(RLVR)提供了一条可行之路,但我们发现,在没有结构化领域先验条件的情况下,标准强化学习难以导航这些广阔的视觉空间。在本文中,我们检讨后训练范式之间的相互作用:比较冷启动监督微调(SFT)、RLVR 和智能体 RLVR 在 UHR RS 基准上的表现。我们的受控研究发现了一个反直觉的结果:高质量的地球科学文本-only 问答是 UHR 视觉推理提升的主要驱动力。尽管缺乏图像,领域特定的文本注入了必要的概念、机制解释和决策规则,以指导视觉证据检索。基于此,我们提出一种分阶段知识注入配方:(1)以可扩展的、经知识图谱验证的地球科学文本 QA 进行冷启动,以灌输推理结构;(2)在相同的困难 UHR 图像-文本示例上进行 SFT,以稳定和放大后续工具型 RL。该方法在 XLRS-Bench 上实现了 60.40% 的 Pass@1,显著优于更大规模的通用模型(如 GPT-5.2、Gemini 3.0 Pro、Intern-S1),并建立了新的学习前沿。

关键词

引用

@article{arxiv.2602.14225,
  title  = {Text Before Vision: Staged Knowledge Injection Matters for Agentic RLVR in Ultra-High-Resolution Remote Sensing Understanding},
  author = {Fengxiang Wang and Mingshuo Chen and Yueying Li and Yajie Yang and Yuhao Zhou and Di Wang and Yifan Zhang and Haoyu Wang and Haiyan Zhao and Hongda Sun and Long Lan and Jun Song and Yulin Wang and Jing Zhang and Wenlong Zhang and Bo Du},
  journal= {arXiv preprint arXiv:2602.14225},
  year   = {2026}
}