中文

SkySenseGPT:面向遥感视觉语言理解的细粒度指令调优数据集与模型

计算机视觉与模式识别 2024-07-09 v2 人工智能

摘要

遥感大型多模态模型(RSLMM)正在快速发展并在遥感图像(RSI)理解方面展现出显著能力。然而,由于现有数据集的局限性,RSLMM 在理解复杂遥感场景中对象间的丰富语义关系方面存在不足。为释放 RSLMM 的复杂理解能力,我们提出了一个大规模指令调优数据集 FIT-RS,包含 1,800,851 条指令样本。FIT-RS 覆盖常见解释任务,创新性地引入了难度递增的几类复杂理解任务,从关系推理到图像级场景图生成。基于 FIT-RS,我们构建了 FIT-RSFG 基准。此外,我们建立了一个用于评估 LMM 细粒度关系理解能力的新基准,命名为 FIT-RSRC。基于组合指令数据,我们提出了 SkySenseGPT,该模型在公共数据集和 FIT-RSFG 上实现卓越表现,超越了现有的 RSLMM。我们希望 FIT-RS 数据集能够增强 RSLMM 的关系理解能力,为遥感社区提供大规模的细粒度数据源。该数据集将在 https://github.com/Luo-Z13/SkySenseGPT 上提供。

关键词

引用

@article{arxiv.2406.10100,
  title  = {SkySenseGPT: A Fine-Grained Instruction Tuning Dataset and Model for Remote Sensing Vision-Language Understanding},
  author = {Junwei Luo and Zhen Pang and Yongjun Zhang and Tingzhu Wang and Linlin Wang and Bo Dang and Jiangwei Lao and Jian Wang and Jingdong Chen and Yihua Tan and Yansheng Li},
  journal= {arXiv preprint arXiv:2406.10100},
  year   = {2024}
}

备注

30 pages, 5 figures, 19 tables, dataset and code see https://github.com/Luo-Z13/SkySenseGPT