CHOICE:评估大型视觉语言模型遥感能力的基准
计算机视觉与模式识别
2025-11-13 v4
摘要
大型视觉语言模型(VLMs),包括通用领域模型和专为遥感设计的模型,已在地球观测任务中展现出卓越的感知和推理能力。然而,尚缺乏系统性评估其在该领域能力的基准。为填补这一空白,我们提出 CHOICE,一个广泛的基准,旨在客观评估 VLMs 在遥感领域的层次化能力。我们聚焦于遥感中至关重要的两个主要能力维度:感知与推理,进一步细分为 6 个次要维度和 23 个叶子任务,以确保全面的评估覆盖。通过严格的流程,从 50 个全球分布城市收集数据,构建问题并进行质量控制,确保所有 10,507 题的质量。新构建的数据和多选题格式(带有确定性答案)允许客观且简便的性能评估。我们评估了 3 个专有模型和 21 个开源 VLMs,揭示了这些模型在这一专业语境中的关键局限性。我们希望 CHOICE 能作为有价值的资源,为 VLMs 在遥感领域的挑战与潜力提供更深入的见解。我们将在 [本链接](https://github.com/ShawnAn-WHU/CHOICE) 上发布 CHOICE。
引用
@article{arxiv.2411.18145,
title = {CHOICE: Benchmarking the Remote Sensing Capabilities of Large Vision-Language Models},
author = {Xiao An and Jiaxing Sun and Zihan Gui and Wei He},
journal= {arXiv preprint arXiv:2411.18145},
year = {2025}
}
备注
Accepted by NeurIPS 2025 Track on Datasets and Benchmarks