深度学习时代重新审视 IM2GPS
计算机视觉与模式识别
2017-05-16 v1
摘要
图像地理定位,即推断图像的地理位置,是一个具有许多潜在应用的计算机视觉难题。该问题近期的最先进方法是一种深度图像分类方法,其中世界被空间划分为网格单元,并训练深度网络来预测给定图像的正确单元。我们提议将该方法与最初的 Im2GPS 方法相结合,后者将查询图像与带地理标签的图像数据库进行匹配,并从检索集合中推断位置。我们通过对参考数据库中其最近邻的位置应用核密度估计来估计查询图像的地理位置。有趣的是,我们发现检索任务的最佳特征源自使用分类损失训练的网络,尽管我们在测试时并未使用分类方法。使用分类损失训练优于几种更典型的用于检索应用的深度特征学习方法(例如带有对比损失或三元组损失的孪生网络)。我们简单的方法实现了最先进的地理定位精度,同时所需训练数据也显著更少。
引用
@article{arxiv.1705.04838,
title = {Revisiting IM2GPS in the Deep Learning Era},
author = {Nam Vo and Nathan Jacobs and James Hays},
journal= {arXiv preprint arXiv:1705.04838},
year = {2017}
}