一种以视觉为中心的遥感基准
计算机视觉与模式识别
2025-05-13 v3
摘要
多模态大语言模型(MLLM)在视觉语言任务中取得了显著的成功,但其遥感(Remote Sensing, RS)对应方面相对缺乏探索。不同于自然图像,遥感图像呈现出独特的挑战,使当前MLLM难以应对,尤其是在视觉锚定和空间推理方面。本研究检视了基于CLIP的MLLM在遥感领域的局限性,突显其在区分视觉上差异大却语义相似的遥感图像时表现不足。为此,我们引入遥感多模态视觉模式基准(Remote Sensing Multimodal Visual Patterns, RSMMVP)。该基准旨在评估MLLM在遥感任务中的表现,通过识别CLIP盲目配对(CLIP-blind pairs),即CLIP基于模型错误地为视觉上差异的遥感图像分配高相似度得分。通过视觉问答(VQA)评估,我们分析了当前最先进MLLM的表现,揭示了在遥感特定表示学习方面存在显著局限。结果为理解基于CLIP的视觉编码弱点,为未来研究开发更有效地针对遥感应用的MLLM提供了基础。
引用
@article{arxiv.2503.15816,
title = {A Vision Centric Remote Sensing Benchmark},
author = {Abduljaleel Adejumo and Faegheh Yeganli and Clifford Broni-bediako and Aoran Xiao and Naoto Yokoya and Mennatullah Siam},
journal= {arXiv preprint arXiv:2503.15816},
year = {2025}
}
备注
Eval-FoMo2 Workshop in CVPR 2025