面向上下文视觉建图的场景检索
计算机视觉与模式识别
2021-02-26 v1 机器人学
摘要
视觉导航将查询地点图像与参考地点图像数据库(亦称“视觉地图”)进行定位。视觉地图中特定区域(“场景类别”)的定位精度要求随环境与任务的上下文而变化。最先进的视觉建图无法通过显式地将场景类别作为地图纳入目标来反映这些要求。在 Nordland 和 St. Lucia 数据集中各识别出四种不同场景类别,包括人行横道与车站。我们没有重新训练难以处理这些重叠场景类别的独立场景分类器,而是做出第一项贡献:定义“场景检索”问题。场景检索将图像检索扩展至在测试时定义的场景分类,通过将单张查询图像关联到场景类别的参考图像。我们的第二项贡献是一个三元组训练的卷积神经网络(CNN)来解决该问题,其相较最先进的为场景识别预训练的网络将场景分类精度提升高达 7%。第二项贡献是一个名为“DMC”的算法,将我们的场景分类与距离及可记忆性结合用于视觉建图。我们的分析表明,DMC 在视觉地图中纳入的所选场景类别图像比仅使用距离间隔建图多 64%。最后使用最先进的视觉地点描述符 AMOS-Net、Hybrid-Net 和 NetVLAD 表明,DMC 在两个数据集上将场景类别定位精度平均提升 3%,其余地图图像的定位精度平均提升 10%。
引用
@article{arxiv.2102.12728,
title = {Scene Retrieval for Contextual Visual Mapping},
author = {William H. B. Smith and Michael Milford and Klaus D. McDonald-Maier and Shoaib Ehsan},
journal= {arXiv preprint arXiv:2102.12728},
year = {2021}
}
备注
8 page paper on visual place recogniton and scene classification