中文

GeoVista:面向超高分辨率遥感理解的视觉扎根主动感知

计算机视觉与模式识别 2026-05-15 v1

摘要

解译超高分辨率(UHR)遥感图像要求模型在大规模场景中搜索稀疏且微小的视觉证据。现有的遥感视觉-语言模型可以使用缩放和裁剪工具检查局部区域,但大多数探索策略要么遵循单次聚焦,要么遵循单一顺序轨迹。这种单一路径探索可能会丢失全局上下文、遗漏分散的区域,并多次重访或计算相同的证据。为此,我们提出 GeoVista,一个用于 UHR 遥感解译的规划驱动主动感知框架。GeoVista 不拘泥于单一的缩放路径,而是首先构建全局探索计划,然后通过分支式局部检查验证多个候选区域,同时维护显式的证据状态以进行跨区域聚合和去重。为实现这一行为,我们引入了 APEX-GRO,一个冷启动监督轨迹语料库,将多样的 UHR 任务重新表述为全局-区域-对象交互推理过程,并采用统一、尺度不变的空间表示。我们进一步设计了用于全局观察、自适应区域检查和证据追踪的观察-规划-跟踪机制,并使用基于 GRPO 的策略对模型进行对齐,该策略针对规划、定位和最终答案的正确性采用逐步奖励。在 RSHR-Bench、XLRS-Bench 和 LRS-VQA 上的实验表明,GeoVista 达到了 SOTA 性能。代码和数据集可在 https://github.com/ryan6073/GeoVista 获取

关键词

引用

@article{arxiv.2605.14475,
  title  = {GeoVista: Visually Grounded Active Perception for Ultra-High-Resolution Remote Sensing Understanding},
  author = {Jiashun Zhu and Ronghao Fu and Jiasen Hu and Nachuan Xing and Xu Na and Xiao Yang and Zhiwen Lin and Weipeng Zhang and Lang Sun and Zhiheng Xue and Haoran Liu and Weijie Zhang and Bo Yang},
  journal= {arXiv preprint arXiv:2605.14475},
  year   = {2026}
}