用于地点识别的孪生网络广义对比优化
计算机视觉与模式识别
2023-04-21 v4
摘要
视觉地点识别是计算机视觉中一项具有挑战性的任务,也是基于相机的定位与导航系统的关键组成部分。近来,卷积神经网络(CNNs)取得了高性能与良好的泛化能力。它们通常以二值方式使用标记为相似或不相似的图像对或三元组进行训练。实际上,两幅图像之间的相似性并非二值的,而是连续的。此外,训练这些 CNNs 计算复杂,并涉及代价高昂的图像对与三元组挖掘策略。我们提出了一种广义对比损失(GCL)函数,其依赖于作为连续度量的图像相似性,并用它训练孪生 CNN。此外,我们提出了三种自动标注图像对及其相似程度标签的技术,并将其用于重新标注 MSLS、TB-Places 和 7Scenes 数据集。我们证明,使用 GCL 函数和改良标注训练的孪生 CNN 始终优于其二元对应模型。我们在 MSLS 上训练的模型优于包括 NetVLAD、NetVLAD-SARE、AP-GeM 和 Patch-NetVLAD 在内的当前最优方法,并在 Pittsburgh30k、Tokyo 24/7、RobotCar Seasons v2 和 Extended CMU Seasons 数据集上泛化良好。此外,使用 GCL 函数训练孪生网络不需要复杂的图像对挖掘。我们在 https://github.com/marialeyvallina/generalized_contrastive_loss 发布了源代码。
引用
@article{arxiv.2103.06638,
title = {Generalized Contrastive Optimization of Siamese Networks for Place Recognition},
author = {María Leyva-Vallina and Nicola Strisciuglio and Nicolai Petkov},
journal= {arXiv preprint arXiv:2103.06638},
year = {2023}
}
备注
Published at CVPR2023 as arXiv:2303.11739