中文

RS5M 与 GeoRSCLIP:面向遥感的大规模视觉-语言数据集与大型视觉-语言模型

计算机视觉与模式识别 2024-09-10 v5 人工智能 计算与语言 多媒体

摘要

利用大规模图像-文本配对数据预训练的视觉-语言模型(VLMs)已展现出前所未有的图像-文本关联能力,在各种下游任务中取得了显著成果。一个关键挑战是如何利用现有的在常见物体上训练的大规模预训练 VLM,来进行领域特定的迁移以完成领域相关的下游任务。一个关键挑战是如何利用现有的在常见物体上训练的大规模预训练 VLM,来进行领域特定的迁移以完成领域相关的下游任务。本文中,我们提出了一个新框架,包含领域预训练视觉-语言模型(DVLM),弥合了通用视觉-语言模型(GVLM)与领域特定下游任务之间的差距。此外,我们呈现了一个遥感(RS)领域的图像-文本配对数据集 RS5M,其拥有 500 万张带英文描述的 RS 图像。该数据集通过筛选公开可用的图像-文本配对数据集并用预训练 VLM 为仅含标签的 RS 数据集生成描述而获得。这构成了首个大规模 RS 图像-文本配对数据集。另外,我们在 RS5M 上微调了 CLIP 模型并尝试了几种参数高效微调(Parameter-Efficient Fine-Tuning)方法以实现 DVLM。实验结果表明,我们提出的数据集对各种任务非常有效,并且我们的模型 GeoRSCLIP 在零样本分类(ZSC)上比基线或先前最优模型提升 3%20%3\%\sim20\%,在遥感跨模态文本-图像检索(RSCTIR)上提升 3%6%3\%\sim6\%,在语义定位(SeLo)任务上提升 4%5%4\%\sim5\%。数据集和模型已发布于:\url{https://github.com/om-ai-lab/RS5M}。

关键词

引用

@article{arxiv.2306.11300,
  title  = {RS5M and GeoRSCLIP: A Large Scale Vision-Language Dataset and A Large Vision-Language Model for Remote Sensing},
  author = {Zilun Zhang and Tiancheng Zhao and Yulong Guo and Jianwei Yin},
  journal= {arXiv preprint arXiv:2306.11300},
  year   = {2024}
}

备注

RS5M dataset v5