中文

面向地球图像的多模态大语言模型空间推理能力评估基准

计算机视觉与模式识别 2026-02-19 v1 人工智能

摘要

对多模态大语言模型(MLLMs)在空间推理能力的基准测试正逐渐受到计算机视觉领域的关注,因为这对于需要精确与物理世界交互的具身AI及其他智能体系统至关重要。然而,由于地球图像独特地需要将对象锚定于地理参考图像上,并利用视觉线索和向量几何坐标(如2D边界框、折线和多边形)进行距离、方向和拓扑关系的定量推理,空间推理进展滞后于其他领域。现有地球图像基准主要聚焦于2D空间锚定、图像描述和粗糙空间关系(如简单方向或接近性线索),缺乏对定量方向和距离推理、系统化拓扑关系以及超出边界框的复杂对象几何的支持。为填补这一空白,我们提出EarthSpatialBench——一个用于评估MLLMs在地球图像上空间推理能力的全面基准。该基准包含超过32.5万对问答对,涵盖:(1)关于空间距离和方向的定性与定量推理;(2)系统化的拓扑关系;(3)单对象查询、对象对查询和组合聚合组查询;(4)通过文本描述、视觉叠加层和显式几何坐标(包括2D边界框、折线和多边形)表达的对象引用。我们对开源和专有模型进行了广泛实验,识别了MLLMs在空间推理方面的局限性。

关键词

引用

@article{arxiv.2602.15918,
  title  = {EarthSpatialBench: Benchmarking Spatial Reasoning Capabilities of Multimodal LLMs on Earth Imagery},
  author = {Zelin Xu and Yupu Zhang and Saugat Adhikari and Saiful Islam and Tingsong Xiao and Zibo Liu and Shigang Chen and Da Yan and Zhe Jiang},
  journal= {arXiv preprint arXiv:2602.15918},
  year   = {2026}
}