中文

GeoRSMLLM:用于地球科学与遥感领域视觉语言任务的多模态大语言模型

计算机视觉与模式识别 2025-03-18 v1 人工智能

摘要

视觉语言模型 (VLM) 在遥感领域的应用已在传统任务(如场景分类、目标检测和图像描述)中展现出显著潜力。然而,当前模型在处理涉及复杂指令(如存在多个条件)或像素级操作(如分割和变化检测)的任务时表现不足。本白皮书提供了遥感视觉语言任务的全面层次化概述,按所需认知能力水平进行分类。我们引入了遥感视觉语言任务集合 (RSVLTS),包括开放词汇任务 (OVT)、指称表达任务 (RET)、描述性目标任务 (DOT) 以及视觉问答 (VQA),其中包含了难度提升的任务。此外,我们提出了一种用于 RSVLTS 的统一数据表示方法,采用点集方法,并引入条件解析器和基于循环指称的自增强策略。这些特征集成到 GeoRSMLLM 模型中,旨在处理 RSVLTS 的广泛任务,为地球科学与遥感领域的视觉语言任务提供更通用的解决方案。

关键词

引用

@article{arxiv.2503.12490,
  title  = {GeoRSMLLM: A Multimodal Large Language Model for Vision-Language Tasks in Geoscience and Remote Sensing},
  author = {Zilun Zhang and Haozhan Shen and Tiancheng Zhao and Bin Chen and Zian Guan and Yuhao Wang and Xu Jia and Yuxiang Cai and Yongheng Shang and Jianwei Yin},
  journal= {arXiv preprint arXiv:2503.12490},
  year   = {2025}
}