中文

遥感基础模型:面向目标定位的多模态大语言模型分析

计算机视觉与模式识别 2025-04-16 v1

摘要

多模态大语言模型(MLLMs)改变了计算机视觉的格局,在包括零样本设置在内的广泛任务中取得了令人瞩目的成果。然而,其优异性能并不总能迁移至分布外领域,例如对地观测(EO)影像。先前的工作表明,MLLMs 在部分 EO 任务(如图像描述和场景理解)中表现出色,但在需要更细粒度空间推理的任务(如目标定位)中表现不佳。然而,MLLMs 发展迅速,相关见解很快就会过时。在本文中,我们分析了经过显式训练以具备细粒度空间推理能力的最新 MLLMs,并在 EO 目标定位任务上对它们进行了基准测试。我们证明这些模型在某些设置下表现良好,非常适合零样本场景。此外,我们提供了侧重于提示选择、地面采样距离(GSD)优化以及失败案例分析详细讨论。我们希望这项工作能为其他研究者在评估 MLLM 是否适合特定 EO 定位任务及如何对其进行优化时提供有价值的参考。

关键词

引用

@article{arxiv.2504.10727,
  title  = {Foundation Models for Remote Sensing: An Analysis of MLLMs for Object Localization},
  author = {Darryl Hannan and John Cooper and Dylan White and Timothy Doster and Henry Kvinge and Yijing Watkins},
  journal= {arXiv preprint arXiv:2504.10727},
  year   = {2025}
}

备注

26 pages, CVPR MORSE Workshop 2025