中文

ProGEO:通过图文对比学习生成提示以用于视觉地理定位

计算机视觉与模式识别 2024-06-05 v1 信息检索

摘要

视觉地理定位(VG)是指识别查询图像中所描述位置的过程,广泛应用于机器人领域和计算机视觉任务,如自动驾驶、元宇宙、增强现实和 SLAM。在缺乏特定文本描述的细粒度图像中,直接应用纯视觉方法来表示邻域特征通常会导致模型聚焦于过于细粒度的特征,无法充分挖掘图像中的语义信息。因此,我们提出了一种两阶段训练方法以增强视觉性能,并使用对比学习来挖掘困难样本。我们首先利用 CLIP (Contrastive Language-Image Pretraining) 的多模态描述能力,为每个地理图像特征创建一组可学习的文本提示,以形成模糊描述。然后,通过利用动态文本提示来辅助图像编码器的训练,我们使图像编码器能够学习到更好、更具泛化能力的视觉特征。这种将文本应用于纯视觉任务的策略,解决了将多模态模型用于地理图像的挑战,这些图像通常因缺乏精确描述而难以被广泛利用。我们在多个大规模视觉地理定位数据集上验证了所提策略的有效性,并且我们的方法在多个视觉地理定位数据集上取得了有竞争力的结果。我们的代码和模型可在 https://github.com/Chain-Mao/ProGEO 获取。

关键词

引用

@article{arxiv.2406.01906,
  title  = {ProGEO: Generating Prompts through Image-Text Contrastive Learning for Visual Geo-localization},
  author = {Chen Mao and Jingqi Hu},
  journal= {arXiv preprint arXiv:2406.01906},
  year   = {2024}
}