基于多尺度有序VLAD池化的城市尺度视觉地点识别与深度局部特征
计算机视觉与模式识别
2023-05-02 v2
摘要
视觉地点识别是指仅基于图像纯视觉外观而不依赖元数据来识别图像中所描绘地点的任务。在视觉地点识别中,挑战不仅在于光照条件、相机视角和尺度的变化,还在于场景级图像的特性以及区域的显著特征。为解决这些挑战,必须同时考虑图像的局部判别性与全局语义上下文。另一方面,数据集的多样性对于开发更具通用性的模型并推动该领域进展也尤为重要。本文提出一个基于内容图像检索的城市尺度地点识别全自动化系统。我们对学界的主要贡献在于三方面。首先,我们对视觉地点识别进行了全面分析,并勾勒出该任务相较于通用图像检索任务的独特挑战。其次,我们在卷积神经网络激活之上提出一种简单的池化方法,将空间信息嵌入图像表示向量。最后,我们引入了用于地点识别的新数据集,这对基于应用的研究尤为关键。此外,通过大量实验,我们分析并讨论了图像检索与地点识别中的各类问题,以期为提升现实检索模型性能提供见解。本文所用数据集见 https://github.com/canhld94/Daejeon520
引用
@article{arxiv.2009.09255,
title = {City-Scale Visual Place Recognition with Deep Local Features Based on Multi-Scale Ordered VLAD Pooling},
author = {Duc Canh Le and Chan Hyun Youn},
journal= {arXiv preprint arXiv:2009.09255},
year = {2023}
}
备注
9 pages