PlaNet——基于卷积神经网络的照片地理定位
计算机视觉与模式识别
2017-02-09 v1
摘要
是否有可能仅利用照片的像素来构建确定其拍摄地点的系统?总体而言,该问题似乎异常困难:构造无法推断任何位置的情形轻而易举。然而,图像常包含信息性线索,如地标、天气模式、植被、道路标线以及建筑细节,这些线索结合可能使人确定近似位置,偶尔也能确定精确位置。诸如GeoGuessr和View from your Window等网站表明,人类相对擅长整合这些线索以对图像进行地理定位,尤其是集体智慧下。在计算机视觉中,照片地理定位问题通常通过图像检索方法解决。相反,我们将该问题表述为分类问题,将地球表面细分为数千个多尺度地理单元,并使用数百万张带地理标签的图像训练深度网络。先前的方法仅识别地标或使用全局图像描述符进行近似匹配,而我们的模型能够利用并整合多个可见线索。我们展示了所得模型PlaNet优于先前方法,且在某些情况下甚至达到超越人类的精度水平。此外,我们通过将模型与长短期记忆(LSTM)架构结合,将其扩展到相册。通过学习利用时间相干性对不确定照片进行地理定位,我们证明了该模型相比单图像模型实现了50%的性能提升。
引用
@article{arxiv.1602.05314,
title = {PlaNet - Photo Geolocation with Convolutional Neural Networks},
author = {Tobias Weyand and Ilya Kostrikov and James Philbin},
journal= {arXiv preprint arXiv:1602.05314},
year = {2017}
}