中文

XLRS-Bench:你的多模态大语言模型能否理解超大尺度遥感影像?

计算机视觉与模式识别 2025-04-01 v1

摘要

多模态大语言模型(MLLM)的惊人突破使得新的基准测试变得必然,以定量评估其能力、揭示其局限性并指示未来研究方向。然而,在遥感(RS)领域,这一任务备受挑战,因为遥感影像分辨率极高,包含极其复杂的语义关系。现有基准测试通常采用显著小于实际遥感场景的图像尺寸、受限于标注质量,且评估维度不足。为此,我们提出了 XLRS-Bench:用于评估 MLLM 在超高分辨率遥感场景下感知与推理能力的全面基准测试。XLRS-Bench 目前观察到的平均图像尺寸最大,达到 8500×8500\times8500,所有评估样本均需通过人工仔细标注,辅以基于超高分辨率遥感图像的新型半自动描述生成器。基于 XLRS-Bench,定义了 16 个子任务,以评估 MLLM 的 10 种感知能力和 6 种推理能力,重点关注促进实际决策-making 和捕捉时空变化的高级认知过程。一般型和遥感专用 MLLM 在 XLRS-Bench 上的结果表明,对于实际遥感应用仍需进一步努力。我们已开源 XLRS-Bench,以支持进一步研究,以发展更强大的遥感 MLLM。

关键词

引用

@article{arxiv.2503.23771,
  title  = {XLRS-Bench: Could Your Multimodal LLMs Understand Extremely Large Ultra-High-Resolution Remote Sensing Imagery?},
  author = {Fengxiang Wang and Hongzhen Wang and Mingshuo Chen and Di Wang and Yulin Wang and Zonghao Guo and Qiang Ma and Long Lan and Wenjing Yang and Jing Zhang and Zhiyuan Liu and Maosong Sun},
  journal= {arXiv preprint arXiv:2503.23771},
  year   = {2025}
}

备注

It has been accepted by CVPR2025