中文

面向开放域图像地理定位的学习型广义零样本学习器

计算机视觉与模式识别 2023-02-02 v1 机器学习

摘要

图像地理定位是预测给定照片拍摄地地理坐标这一极具挑战性的任务。它是一个未解决的问题,依赖于将视觉线索与关于世界的通用知识相结合,以跨地域做出准确预测的能力。我们提出\href\href{https://huggingface.co/geolocal/StreetCLIP}{\text{StreetCLIP}},一个鲁棒且公开可用的基础模型,不仅在多个开放域图像地理定位基准上达到最先进性能,而且是在零样本设定下做到的,优于在超过400万张图像上训练的监督模型。我们的方法引入了一种通过从合成描述预训练CLIP、将CLIP锚定于选定领域来实现广义零样本学习的元学习方法。我们表明,该方法有效将CLIP的广义零样本能力迁移至图像地理定位领域,在不对StreetCLIP在固定类别集上微调的情况下提升了域内广义零样本性能。

关键词

引用

@article{arxiv.2302.00275,
  title  = {Learning Generalized Zero-Shot Learners for Open-Domain Image Geolocalization},
  author = {Lukas Haas and Silas Alberti and Michal Skreta},
  journal= {arXiv preprint arXiv:2302.00275},
  year   = {2023}
}