中文

基于神经网络特征视频地理定位

计算机视觉与模式识别 2018-10-24 v2 信息检索

摘要

在这项工作中,我们提出了一种仅基于视频帧视觉内容在限定广泛区域内对视频进行地理定位的方法。我们提出的方法通过以 Google 街景为参考点的传统图像检索技术来解决视频地理定位问题。为实现此目标,我们使用从 NetVLAD 获得的深度学习特征来表示图像,因为通过该特征向量,其相似度为它们的 L2 范数。在本文中,我们提出了一系列基于投票的方法来聚合逐帧地理定位结果,从而提升视频地理定位结果。我们通过实验发现的最佳聚合方式同时考虑了 NetVLAD 和 SIFT 相似度,以及最相似结果的地理定位密度。为测试我们提出的方法,我们从匹兹堡市中心区域收集了一个新的视频数据集,以裨益并激励该领域的更多工作。我们的系统在 150 米或距原始位置两个街区的范围内对视频进行地理定位时达到了 90% 的准确率。

关键词

引用

@article{arxiv.1810.09068,
  title  = {Where is this? Video geolocation based on neural network features},
  author = {Salvador Medina and Zhuyun Dai and Yingkai Gao},
  journal= {arXiv preprint arXiv:1810.09068},
  year   = {2018}
}