RSGPT:一种遥感视觉语言模型与基准
计算机视觉与模式识别
2023-07-31 v1
摘要
以GPT-4为代表的大规模大语言模型的出现,显著推动了通用人工智能的快速发展并引发了人工智能2.0的革命。在遥感(RS)领域,针对该领域数据分析开发专用大型视觉语言模型(VLM)的兴趣日益增长。然而,当前研究主要围绕视觉识别任务,缺乏适用于训练大型VLM的、对齐且全面的大规模图像-文本数据集,这对有效训练此类遥感应用模型构成重大挑战。在计算机视觉中,近期研究表明,在小规模高质量数据集上微调大型视觉语言模型,可在视觉与语言理解上取得令人印象深刻的性能,可与如GPT-4般从海量数据从头训练的最先进VLM相媲美。受此引人入胜的想法启发,本工作中我们构建了高质量遥感图像描述数据集(RSICap),以促进遥感领域大型VLM的发展。不同于以往采用模型生成描述或简短说明的遥感数据集,RSICap包含2,585条人工标注、信息丰富且高质量的描述。该数据集为每幅图像提供详细描述,涵盖场景描述(如住宅区、机场或农田)以及对象信息(如颜色、形状、数量、绝对位置等)。为便于评估遥感领域VLM,我们还提供了称为RSIEval的基准评估数据集。该数据集由人工标注的描述与视觉问答对组成,可对遥感语境下VLM进行全面评估。
引用
@article{arxiv.2307.15266,
title = {RSGPT: A Remote Sensing Vision Language Model and Benchmark},
author = {Yuan Hu and Jianlong Yuan and Congcong Wen and Xiaonan Lu and Xiang Li},
journal= {arXiv preprint arXiv:2307.15266},
year = {2023}
}