基于知识蒸馏和可变形聚合的参数高效视觉基石模型视觉地点识别方法
计算机视觉与模式识别
2025-12-30 v4
摘要
视觉地点识别(VPR)旨在通过检索地理标记参考数据库中与查询图像最视觉相似的对应图像来确定查询图像的地理位置。最近,强大的视觉基石模型 DINOv2 在大规模数据集上以自监督方式训练,显著提升了 VPR 的性能。这种提升源于 DINOv2 卓越的特征泛化能力,但往往伴随着模型复杂度和计算开销的增加,阻碍在资源受限设备上的部署。为解决这一挑战,我们提出 -VPR,一个 istillation- and eformable-based 框架,在保持视觉基石模型强大特征提取能力的同时,显著减少模型参数,实现更佳的性能-效率权衡。具体而言,首先,我们采用两阶段训练策略集成知识蒸馏和微调。此外,我们引入蒸馏恢复模块(DRM)以更好地对齐教师和学生模型之间的特征空间,从而最大程度地最小化知识传输损失。其次,我们设计基于自上而下注意力的可变形聚合器(TDDA),利用全局语义特征动态地自适应地调整用于聚合的感兴趣区域(ROI),从而提高对不规则结构的适应性。大量实验表明,我们的方法在性能上与最先进的方法持相当水平,同时将参数数量减少约 64.2%(相对于 CricaVPR)。代码可在 https://github.com/tony19980810/D2VPR 查阅。
引用
@article{arxiv.2511.12528,
title = {D$^{2}$-VPR: A Parameter-efficient Visual-foundation-model-based Visual Place Recognition Method via Knowledge Distillation and Deformable Aggregation},
author = {Zheyuan Zhang and Jiwei Zhang and Boyu Zhou and Linzhimeng Duan and Hong Chen},
journal= {arXiv preprint arXiv:2511.12528},
year = {2025}
}