中文

RS-GPT4V:遥感图像理解的统一多模态指令跟随数据集

计算机视觉与模式识别 2024-06-19 v1 人工智能

摘要

遥感图像智能理解模型正在经由多模态大语言模型(MLLM)实现全新深刻范式变革,这种变革将从学习领域模型(LaDM)的范式,转向学习预训练通用基础模型后再适配领域模型(LaGD)的范式。在新LaGD范式下,过去十年推动遥感图像(RSI)智能理解发展的旧数据集已不再适用于新任务。我们认为必须设计新数据集,以满足以下特征:1)通用性:训练模型以学习任务间共享知识并适应不同任务;2)理解复杂场景:训练模型理解感兴趣对象的细粒属性,并能以自然语言描述场景;3)推理能力:训练模型实现高层次视觉推理。本文设计了由GPT-4V生成的高质量、多样化且统一的遥感图像理解多模态指令跟随数据集,称为RS-GPT4V。为实现通用性,我们采用由GPT-4V通过指令跟随推导得出的(问题,答案)格式,以统一诸如标述和定位等任务;为实现复杂场景,我们提出了具有层次结构指令描述的方案,其中包含对感兴趣对象细粒属性及其空间关系的描述,以及全局策略,将所有局部信息整合以生成详尽指令描述;为实现推理能力,我们设计了多轮问答配对以提供模型推理能力。实证结果表明,基于RS-GPT4V微调的MLLM能够描述细粒信息。数据集已公开:https://github.com/GeoX-Lab/RS-GPT4V。

关键词

引用

@article{arxiv.2406.12479,
  title  = {RS-GPT4V: A Unified Multimodal Instruction-Following Dataset for Remote Sensing Image Understanding},
  author = {Linrui Xu and Ling Zhao and Wang Guo and Qiujun Li and Kewang Long and Kaiqi Zou and Yuhan Wang and Haifeng Li},
  journal= {arXiv preprint arXiv:2406.12479},
  year   = {2024}
}

备注

14 pages, 6 figures, 4 tables