中文

RSTeller:基于开放数据与大语言模型构建遥感视觉语言模型的语义丰富性扩展

计算机视觉与模式识别 2025-05-27 v4 人工智能

摘要

丰富且经过标注的多模态遥感数据对于将复杂的遥感场景与人类语言对齐,使开发针对各种遥感解释任务的专用视觉语言模型成为可能。然而,大规模标注具有丰富语言语义的遥感图像需要专业知识和大量人力,成本高昂且往往不可行。本研究提出一种工作流程,利用大语言模型(LLM)从 OpenStreetMap(OSM)数据中为来自 Google Earth Engine(GEE)平台的图像生成语义丰富的多模态数据集。该方法便于大规模生成遥感数据并可轻松扩展。我们在此框架内提出RSTeller,一个包含超过130万张遥感图像的多模态数据集,每张图像配有两个描述性说明。大量实验表明,RSTeller通过持续预训练显著提升了多个现有视觉语言模型在遥感场景理解任务中的性能。我们的 methodology 显著减少了为遥感图像标注专业知识和人力工作,同时 democratizes 高质量标注数据的获取。这一进展推动了视觉语言建模的发展,并鼓励更广泛的参与者参与遥感研究和应用。RSTeller 数据集可在 https://github.com/SlytherinGe/RSTeller 获取。

关键词

引用

@article{arxiv.2408.14744,
  title  = {RSTeller: Scaling Up Visual Language Modeling in Remote Sensing with Rich Linguistic Semantics from Openly Available Data and Large Language Models},
  author = {Junyao Ge and Xu Zhang and Yang Zheng and Kaitai Guo and Jimin Liang},
  journal= {arXiv preprint arXiv:2408.14744},
  year   = {2025}
}

备注

Published on ISPRS, minor typos corrected