面向视觉位置识别的全局代理困难样本挖掘
计算机视觉与模式识别
2023-03-01 v1
摘要
学习用于视觉位置识别的深度表示通常使用成对或三元损失函数,这些函数高度依赖于每次训练迭代中所采样样本的困难度。现有技术通过使用计算和内存开销昂贵的离线困难样本挖掘来解决此问题,即在每次迭代时从训练集中识别出最困难的样本。本文引入一种基于代理的全局困难小批量采样新技术。为此,我们在网络中添加了一个新的端到端可训练分支,用于生成高效的位置描述符(每个位置一个代理)。这些代理表示随后被用于构建一个涵盖数据集中所有位置之间相似度的全局索引,从而在每次训练迭代时实现信息量极高的小批量采样。我们的方法可以与所有现有的成对和三元损失函数结合使用,且仅带来可忽略不计的额外内存和计算成本。我们进行了广泛的消融研究,并表明我们的技术在Pittsburgh、Mapillary-SLS和SPED等多个大规模基准上带来了新的SOTA性能。特别是在具有挑战性的Nordland数据集上,我们的方法提供了超过100%的相对提升。代码可在 https://github.com/amaralibey/GPM 获取。
引用
@article{arxiv.2302.14217,
title = {Global Proxy-based Hard Mining for Visual Place Recognition},
author = {Amar Ali-bey and Brahim Chaib-draa and Philippe Giguère},
journal= {arXiv preprint arXiv:2302.14217},
year = {2023}
}
备注
Accepted at BMVC 2022