中文

SelaVPR++:迈向基础模型的无缝适配以实现高效地点识别

计算机视觉与模式识别 2025-11-10 v2

摘要

近期研究表明,使用预训练视觉基础模型的地点识别(VPR)方法可以实现有前景的性能。在我们之前的工作中,我们提出了一种新颖的方法来实现基础模型对VPR的无缝适配(SelaVPR)。该方法通过参数高效的适配方法,能够生成全局和局部特征,这些特征聚焦于判别性地标,用于两阶段VPR的地点识别。尽管SelaVPR已取得有竞争力的结果,但我们认为先前的适配在训练时间和GPU内存使用方面效率低下,且重排序范式在检索延迟和存储使用方面也代价高昂。为了追求更高的效率和更好的性能,我们提出了SelaVPR的扩展,称为SelaVPR++。具体来说,我们首先设计了一种参数、时间和内存高效的适配方法,该方法使用轻量级多尺度卷积(MultiConv)适配器来细化冻结基础骨干的中间特征。这种适配方法在训练期间不通过骨干反向传播梯度,并且MultiConv适配器促进了沿空间轴的特征交互并引入了适当的局部先验,从而实现了更高的效率和更好的性能。此外,我们提出了一种创新的重排序范式,以实现更高效的VPR。我们不依赖局部特征进行重排序(这会带来巨大的延迟和存储开销),而是采用紧凑的二进制特征进行初始检索,并使用稳健的浮点(全局)特征进行重排序。为获得此类二进制特征,我们提出了一种相似性约束的深度哈希方法,该方法可以轻松集成到VPR流程中。最后,我们改进了训练策略,并统一了多个常见训练数据集的训练协议,以合并它们来更好地训练VPR模型。大量实验表明……

关键词

引用

@article{arxiv.2502.16601,
  title  = {SelaVPR++: Towards Seamless Adaptation of Foundation Models for Efficient Place Recognition},
  author = {Feng Lu and Tong Jin and Xiangyuan Lan and Lijun Zhang and Yunpeng Liu and Yaowei Wang and Chun Yuan},
  journal= {arXiv preprint arXiv:2502.16601},
  year   = {2025}
}

备注

accepted by T-PAMI