我们在何处与在看什么:基于查询的利用层次结构与场景的全局图像地理定位
计算机视觉与模式识别
2023-03-09 v1
摘要
确定照片拍摄的精确纬度和经度是一项有用且应用广泛的任务,尽管其他计算机视觉任务进展迅速,它仍异常困难。大多数先前方法选择学习查询图像的单一表示,然后在不同地理粒度级别上分类。这些方法未能利用为不同层次(如国家、州、城市级别)提供上下文的不同视觉线索。为此,我们引入一种端到端基于 transformer 的架构,通过层次化交叉注意力来利用不同地理级别(我们称之为层次)与图像中对应视觉场景信息之间的关系。我们通过对每个地理层次和场景类型学习一个查询来实现这一点。此外,我们为不同环境场景学习单独表示,因为同一位置的不同场景通常由完全不同的视觉特征定义。我们在 4 个标准地理定位数据集:Im2GPS、Im2GPS3k、YFCC4k 和 YFCC26k 上取得了最优的街道级精度,并定性展示了我们的方法如何为不同视觉层次和场景学习不同表示,这是先前方法未展示过的。这些先前的测试数据集大多由标志性地标或社交媒体图像组成,使它们要么是记忆任务,要么偏向某些地方。为解决此问题,我们引入一个更难的测试数据集 Google-World-Streets-15k,由来自 Google Streetview 覆盖全球的图片组成,并给出最优结果。我们的代码将在最终版本中公开。
引用
@article{arxiv.2303.04249,
title = {Where We Are and What We're Looking At: Query Based Worldwide Image Geo-localization Using Hierarchies and Scenes},
author = {Brandon Clark and Alec Kerrigan and Parth Parag Kulkarni and Vicente Vivanco Cepeda and Mubarak Shah},
journal= {arXiv preprint arXiv:2303.04249},
year = {2023}
}
备注
CVPR 2023