中文

RemoteCLIP:一种面向遥感视觉语言基础模型

计算机视觉与模式识别 2024-04-17 v4

摘要

通用基础模型已带来人工智能近期的突破。在遥感领域,自监督学习(SSL)与掩码图像建模(MIM)已被用于构建基础模型。然而,这些模型主要学习低级特征且需要标注数据微调。此外,由于缺乏语言理解,它们不适用于检索与零样本应用。为克服这些局限,我们提出 RemoteCLIP,首个面向遥感的视觉语言基础模型,旨在学习具有丰富语义的鲁棒视觉特征及对齐的文本嵌入,以无缝衔接下游应用。为解决预训练数据稀缺问题,我们采用数据扩展,基于 Box-to-Caption(B2C)与 Mask-to-Box(M2B)转换将异构标注转为统一的图像-描述数据格式。通过进一步引入无人机影像,我们生成的预训练数据集规模达所有可用数据集总和的 12 倍。RemoteCLIP 可应用于多种下游任务,包括零样本图像分类、线性探测、k\textit{k}-NN 分类、少样本分类、图文检索及遥感图像中目标计数。在 16 个数据集上的评估(含新引入用于测试目标计数能力的 RemoteCount 基准)表明,RemoteCLIP 在不同模型规模下持续优于基线基础模型。令人印象深刻的是,RemoteCLIP 在 RSITMD 数据集上以 9.14% 平均召回率、在 RSICD 数据集上以 8.92% 优于最优方法。零样本分类中,我们的 RemoteCLIP 在 12 个下游数据集上平均准确率最高超越 CLIP 基线 6.39%。项目网站:https://github.com/ChenDelong1999/RemoteCLIP

关键词

引用

@article{arxiv.2306.11029,
  title  = {RemoteCLIP: A Vision Language Foundation Model for Remote Sensing},
  author = {Fan Liu and Delong Chen and Zhangqingyun Guan and Xiaocong Zhou and Jiale Zhu and Qiaolin Ye and Liyong Fu and Jun Zhou},
  journal= {arXiv preprint arXiv:2306.11029},
  year   = {2024}
}

备注

Accepted by IEEE Transactions on Geoscience and Remote Sensing (TGRS)