中文

ZoomEarth:面向超高分辨率遥感视觉语言任务的主动感知

计算机视觉与模式识别 2025-11-18 v1

摘要

超高分辨率(UHR)遥感图像提供丰富的细粒度信息,但也带来了有效处理的挑战。现有的动态分辨率和token剪枝方法受限于被动感知范式,当获取更细的视觉输入时会产生冗余。本文探索一种新的主动感知范式,使模型能够重新访问信息丰富的区域。首先,我们提出LRS-GRO,一个针对UHR遥感处理主动感知的大规模基准数据集,涵盖全球、区域和对象级别的17种问题类型,通过半自动化流程进行标注。基于LRS-GRO,我们提出ZoomEarth,一种自适应裁剪-放大框架,引入新颖的区域引导奖励(Region-Guided reward),提供细粒度指导。通过监督微调(SFT)和群体相对策略优化(GRPO)训练,ZoomEarth在LRS-GRO上实现了最先进的性能,并在零样本设置下在三个公开的UHR遥感基准测试中取得优异成绩。此外,ZoomEarth可以通过简单的工具接口无缝集成到面向云 removal、去噪、分割和图像编辑等下游任务的模型中,显示出强大的 versatility 和可扩展性。

关键词

引用

@article{arxiv.2511.12267,
  title  = {ZoomEarth: Active Perception for Ultra-High-Resolution Geospatial Vision-Language Tasks},
  author = {Ruixun Liu and Bowen Fu and Jiayi Song and Kaiyu Li and Wanchen Li and Lanxuan Xue and Hui Qiao and Weizhan Zhang and Deyu Meng and Xiangyong Cao},
  journal= {arXiv preprint arXiv:2511.12267},
  year   = {2025}
}