DC-VLAQ: 用于鲁棒视觉地点识别的查询残差聚合
计算机视觉与模式识别
2026-01-21 v1 机器人学
摘要
视觉地点识别(VPR)的核心挑战之一是学习一个鲁棒的全局表示,该表示在大的视角变化、光照变化和严重的域偏移下仍能保持判别性。虽然视觉基础模型(VFM)提供了强大的局部特征,但大多数现有方法依赖于单一模型,忽略了不同VFM提供的互补线索。然而,利用这种互补信息不可避免地会改变标记分布,这对现有基于查询的全局聚合方案的稳定性提出了挑战。为了解决这些挑战,我们提出了DC-VLAQ,一个以表示为中心的框架,它整合了互补VFM的融合和鲁棒的全局聚合。具体来说,我们首先引入了一个轻量级的残差引导互补融合,将表示锚定在DINOv2特征空间中,同时通过学习的残差校正从CLIP注入互补语义。此外,我们提出了局部聚合查询向量(VLAQ),一种查询-残差全局聚合方案,该方案通过局部标记对可学习查询的残差响应来编码它们,从而提高了稳定性并保留了细粒度的判别线索。在标准VPR基准(包括Pitts30k、Tokyo24/7、MSLS、Nordland、SPED和AmsterTime)上的大量实验表明,DC-VLAQ持续优于强基线,并达到了最先进的性能,特别是在具有挑战性的域偏移和长期外观变化下。
引用
@article{arxiv.2601.12729,
title = {DC-VLAQ: Query-Residual Aggregation for Robust Visual Place Recognition},
author = {Hanyu Zhu and Zhihao Zhan and Yuhang Ming and Liang Li and Dibo Hou and Javier Civera and Wanzeng Kong},
journal= {arXiv preprint arXiv:2601.12729},
year = {2026}
}
备注
10 pages, 4 figures, 5 tables