中文

Sat2Cap:从卫星影像映射细粒度文本描述

计算机视觉与模式识别 2024-04-15 v2

摘要

我们提出一种弱监督方法,利用自由形式文本描述创建地图。我们将这种创建文本地图的工作称为零样本映射。先前工作通过开发模型使用俯视影像预测固定的一组属性来处理映射任务。然而,这些模型限制性很强,因为它们只能解决训练时所针对的高度特定任务。另一方面,映射文本使我们能够以最小限制解决大量映射问题。为此,我们在一个包含 610 万对俯视与地面影像的新大规模数据集上训练了一个称为 Sat2Cap 的对比学习框架。对于给定的位置和俯视影像,我们的模型预测地面景色的期望 CLIP 嵌入。预测的 CLIP 嵌入随后被用于学习与该位置相关的文本空间。Sat2Cap 还以日期-时间信息为条件,从而能够对一个位置随时间变化的概念进行建模。我们的实验结果表明,我们的模型成功捕获了地面级概念,并允许对细粒度文本查询进行大规模映射。我们的方法不需要任何文本标注数据,使训练易于扩展。代码、数据集和模型将公开提供。

关键词

引用

@article{arxiv.2307.15904,
  title  = {Sat2Cap: Mapping Fine-Grained Textual Descriptions from Satellite Images},
  author = {Aayush Dhakal and Adeel Ahmad and Subash Khanal and Srikumar Sastry and Hannah Kerner and Nathan Jacobs},
  journal= {arXiv preprint arXiv:2307.15904},
  year   = {2024}
}

备注

16 pages