GeoViS:面向遥感图像的空间奖励视觉搜索
计算机视觉与模式识别
2025-12-03 v1
摘要
近期多模态大语言模型(MLLM)的进展推动了视觉定位在文本查询与图像区域之间实现精细的跨模态对齐,但将此类能力迁移到遥感图像仍具挑战——目标往往位于千米尺度场景中的极小区域,查询通常涉及复杂的地理空间关系,如相对位置、空间层次或跨远离对象的上下文依赖。为此,我们提出GeoViS——一个空间奖励视觉搜索框架,将遥感视觉定位重新表述为逐步搜索与推理过程。GeoViS通过树状序列的视觉线索主动探索全局图像,集成多模态感知、空间推理和奖励导向的探索,以迭代细化地理空间假设。该设计使模型能够检测细微的小尺度目标,同时保持整体场景意识。广泛的实验在五个遥感定位基准数据集上表明,GeoViS实现了精确的地理空间理解, consistently 超越了现有方法在关键视觉定位指标上的表现,凸显了其强大的跨域泛化和可解释性。
引用
@article{arxiv.2512.02715,
title = {GeoViS: Geospatially Rewarded Visual Search for Remote Sensing Visual Grounding},
author = {Peirong Zhang and Yidan Zhang and Luxiao Xu and Jinliang Lin and Zonghao Guo and Fengxiang Wang and Xue Yang and Kaiwen Wei and Lei Wang},
journal= {arXiv preprint arXiv:2512.02715},
year = {2025}
}
备注
11 pages, 4 figures