中文

GeoLLaVA-8K:将遥感多模态大语言模型扩展至 8K 分辨率

计算机视觉与模式识别 2025-11-05 v2

摘要

超高分辨率(UHR)遥感(RS)影像为地球观测提供了宝贵数据,但由于两个关键瓶颈,对现有的多模态基础模型构成了挑战:(1)UHR 训练数据可用性有限,以及(2)大图像尺寸导致的 token 爆炸。为解决数据稀缺问题,我们引入了 SuperRS-VQA(平均 8,376×\times8,376)和 HighRS-VQA(平均 2,000×\times1,912),这是迄今为止遥感领域分辨率最高的视觉-语言数据集,涵盖 22 个真实世界的对话任务。为缓解 token 爆炸,我们的初步研究揭示了遥感图像中的显著冗余:关键信息集中于一小部分以对象为中心的 token 中,而修剪背景 token(如海洋或森林)甚至能提升性能。受这些发现启发,我们提出了两种策略:背景 token 修剪和锚定 token 选择,以在保留关键语义的同时减少内存占用。结合这些技术,我们引入了 GeoLLaVA-8K,这是首个能够处理高达 8K×\times8K 分辨率输入的遥感专用多模态大语言模型,基于 LLaVA 框架构建。在 SuperRS-VQA 和 HighRS-VQA 上训练后,GeoLLaVA-8K 在 XLRS-Bench 上创造了新的 SOTA。

关键词

引用

@article{arxiv.2505.21375,
  title  = {GeoLLaVA-8K: Scaling Remote-Sensing Multimodal Large Language Models to 8K Resolution},
  author = {Fengxiang Wang and Mingshuo Chen and Yueying Li and Di Wang and Haotian Wang and Zonghao Guo and Zefan Wang and Boqi Shan and Long Lan and Yulin Wang and Hongzhen Wang and Wenjing Yang and Bo Du and Jing Zhang},
  journal= {arXiv preprint arXiv:2505.21375},
  year   = {2025}
}

备注

NeurlPS 2025 Spotlight