面向跨视角图像地理定位的最优特征传输
计算机视觉与模式识别
2019-11-28 v3
摘要
本文研究跨视角图像地理定位问题,即通过将该地理定位查询图像与大规模航拍地图(例如高分辨率卫星图像)进行匹配来估计地面街景查询图像的地理位置。最先进的基于深度学习的方法将这一问题作为深度度量学习来处理,旨在学习两种不同视角所看到场景的全局特征表示。尽管此类深度度量学习方法取得了有前景的结果,但它们未能利用与定位相关的一个关键线索,即局部特征的空间布局。此外,在跨视角定位背景下,很少有人关注(航拍视角与地面视角之间)明显的域差距。本文提出一种新颖的跨视角特征传输(CVFT)技术,以显式地建立跨视角域迁移,从而促进地面与航拍图像之间的特征对齐。具体而言,我们将 CVFT 实现为网络层,将特征从一域传输到另一域,从而实现更有意义的特征相似度比较。我们的模型可微且可端到端学习。在大规模数据集上的实验表明,我们的方法显著提升了最先进的跨视角定位性能,例如在 CVUSA 数据集上,top-1 召回率从 40.79% 显著提升至 61.43%,top-10 从 76.36% 提升至 90.49%。我们期望本文的核心见解(即通过域传输显式处理域差异)也能证明对计算机视觉中其他类似问题有用。
引用
@article{arxiv.1907.05021,
title = {Optimal Feature Transport for Cross-View Image Geo-Localization},
author = {Yujiao Shi and Xin Yu and Liu Liu and Tong Zhang and Hongdong Li},
journal= {arXiv preprint arXiv:1907.05021},
year = {2019}
}