中文

GeoVision Labeler:基于视觉与语言模型的零样本地理空间分类

计算机视觉与模式识别 2025-06-02 v1 计算与语言 机器学习

摘要

对地理空间图像进行分类仍然是灾害响应和土地利用监测等应用的主要瓶颈——特别是在标注数据稀缺或不可用的地区。现有声称具备卫星图像零样本分类能力的工具(如 RS-CLIP)依然依赖于特定任务的预训练和适配才能达到有竞争力的性能。我们引入了 GeoVision Labeler(GVL),一个严格的零样本分类框架:视觉大语言模型(vLLM)生成丰富且人类可读的图像描述,随后由传统大语言模型(LLM)将其映射到用户定义的类别。这种模块化且可解释的流程能够为大量用例提供灵活的图像分类。我们在三个基准测试上评估了 GVL——SpaceNet v7、UC Merced 和 RESISC45。它在 SpaceNet v7 的二元“建筑物 vs. 非建筑物”任务上实现了高达 93.2% 的零样本准确率。对于复杂的多类分类任务(UC Merced、RESISC45),我们实现了递归的 LLM 驱动聚类,在连续深度上形成元类,随后进行层次分类——先解决粗粒度分组,再处理更细粒度的区分——以提供具有竞争力的零样本性能。GVL 已在 https://github.com/microsoft/geo-vision-labeler 开源,以促进其在真实世界地理空间工作流中的采用。

关键词

引用

@article{arxiv.2505.24340,
  title  = {GeoVision Labeler: Zero-Shot Geospatial Classification with Vision and Language Models},
  author = {Gilles Quentin Hacheme and Girmaw Abebe Tadesse and Caleb Robinson and Akram Zaytar and Rahul Dodhia and Juan M. Lavista Ferres},
  journal= {arXiv preprint arXiv:2505.24340},
  year   = {2025}
}