中文

通过地面与遥感对齐构建无需标注的遥感视觉-语言基础模型

计算机视觉与模式识别 2023-12-13 v1 机器学习

摘要

我们引入了一种在无需任何文本标注的情况下为遥感图像训练视觉-语言模型的方法。我们的核心见解是使用在地面上拍摄的互联网共置图像作为连接遥感图像与语言的媒介。具体而言,我们利用大量成对的互联网图像与卫星图像,训练一个遥感图像的图像编码器,使其与CLIP的图像编码器对齐。我们的无监督方法使得训练一种首创的大规模遥感图像视觉-语言模型(VLM)成为可能,且支持两种不同的分辨率。我们表明,这些VLM能够实现卫星图像的零样本、开放词汇图像分类、检索、分割和视觉问答。在每项任务中,我们无需文本标注训练的VLM均优于现有在监督下训练的VLM,其中分类增益高达20%,分割增益高达80%。

关键词

引用

@article{arxiv.2312.06960,
  title  = {Remote Sensing Vision-Language Foundation Models without Annotations via Ground Remote Alignment},
  author = {Utkarsh Mall and Cheng Perng Phoo and Meilin Kelsey Liu and Carl Vondrick and Bharath Hariharan and Kavita Bala},
  journal= {arXiv preprint arXiv:2312.06960},
  year   = {2023}
}