中文

BoQ:一个地方值得一袋可学习查询

计算机视觉与模式识别 2024-11-14 v3

摘要

在视觉位置识别中,准确识别和匹配在不同环境条件和视角下的位置图像仍然是一个重要挑战。本文引入了一种新技术,称为 Bag-of-Queries (BoQ),它学习一组全局查询,以捕获通用的地方特定属性。不同于现有方法使用自注意力并直接从输入特征生成查询的做法,BoQ 采用独立的可学习全局查询,通过交叉注意力探测输入特征,确保一致的信息聚合。此外,本技术提供可解释的注意力机制,并与 CNN 和 Vision Transformer 主干网络集成。通过在 14 个大型基准测试上的大量实验,展示了 BoQ 的性能。它持续优于包括 NetVLAD、MixVPR 和 EigenPlaces 在内的当前最先进技术。此外,作为一种全局检索技术(单阶段),BoQ 在速度和效率上远超诸如 Patch-NetVLAD、TransVPR 和 R2Former 等两阶段检索方法。该代码和模型权重已公开于 https://github.com/amaralibey/Bag-of-Queries。

关键词

引用

@article{arxiv.2405.07364,
  title  = {BoQ: A Place is Worth a Bag of Learnable Queries},
  author = {Amar Ali-Bey and Brahim Chaib-draa and Philippe Giguère},
  journal= {arXiv preprint arXiv:2405.07364},
  year   = {2024}
}

备注

Accepted at CVPR 2024