基于自适应缩放搜索的训练免费超高分辨率遥感 VQA
计算机视觉与模式识别
2025-12-01 v2
摘要
随着卫星星座、传感器技术和成像管线的进步,超高分辨率(Ultra-HR)遥感图像正变得越来越普遍。然而,当前的遥感基础模型不适用于此类输入:全图像编码耗尽了标记和内存预算,而基于缩放的预处理会丢失细粒度和答案关键细节。在此背景下,在预测前引导模型关注关键区域变得至关重要。因此,我们提出了 ZoomSearch,一个无需训练、即插即用的管线,旨在为 Ultra-HR 遥感视觉问答(RS-VQA)解耦“关注何处”与“如何回答”。ZoomSearch 结合自适应多分支缩放搜索,这种方法对图像块进行分层搜索以局部化查询相关区域,以及布局感知块重组,该方法将选定块重新组织为紧凑且富于布局感的画布。我们在 Ultra-HR RS-VQA 数据集 MME-RealWorld-RS 和 LRS-VQA 上进行了全面实验,比较了(i)强大的通用基础模型,(ii)遥感基础模型,(iii)Ultra-HR RS-VQA 方法,以及(iv)即插即用的搜索-based VQA 方法。当与 LLaVA-ov 集成时,ZoomSearch 在各种任务中实现了准确率突破,LRS-VQA 提升 26.3%,MME-RealWorld-RS 提升 114.8%。同时,它在推理效率方面表现出更高的性能,相对于先前的搜索-based 方法在速度上提升 20%~44%。
引用
@article{arxiv.2511.20460,
title = {Look Where It Matters: Training-Free Ultra-HR Remote Sensing VQA via Adaptive Zoom Search},
author = {Yunqi Zhou and Chengjie Jiang and Chun Yuan and Jing Li},
journal= {arXiv preprint arXiv:2511.20460},
year = {2025}
}
备注
17 pages, 8 figures