中文

VLAD-BuFF:面向视觉定位的突发式快速特征聚合

计算机视觉与模式识别 2024-10-01 v1

摘要

视觉定位 (VPR) 是许多用于具身智能体的视觉定位管线中的关键组件。VPR 常被建模为图像检索任务,以联合学习局部特征和聚合方法。当前的最先进 VPR 方法依赖 VLAD 聚合,该方法可通过对特征对簇中心的软分配来学习特征贡献的加权。然而,该过程存在两个关键局限性。首先,特征到簇的加权未能考虑簇内过度代表的重复结构(例如阴影或窗格),这也被称为“突发性”问题,经典解决方法是在聚合前对重复特征进行贬值。其次,特征到簇的比较在高维局部特征的先进图像编码器上计算开销巨大。本文通过引入 VLAD-BuFF,提出两种新方法:i) 基于自相似性的特征贬值机制,以学习端到端 VPR 训练中的突发式特征;ii) 通过特定采用 PCA 初始化的可学习预投影来加速局部特征聚合。我们在 9 个公开数据集上进行基准测试,VLAD-BuFF 取得了新的最先进成绩。该方法能够在 12 倍降低局部特征维度的情况下保持高召回率,从而在不牺牲召回率的前提下实现快速特征聚合。通过额外的定性研究,我们展示了所提出的加权方法有效地降低了非具象征性特征的权重。源码:https://github.com/Ahmedest61/VLAD-BuFF/。

关键词

引用

@article{arxiv.2409.19293,
  title  = {VLAD-BuFF: Burst-aware Fast Feature Aggregation for Visual Place Recognition},
  author = {Ahmad Khaliq and Ming Xu and Stephen Hausler and Michael Milford and Sourav Garg},
  journal= {arXiv preprint arXiv:2409.19293},
  year   = {2024}
}

备注

Presented at ECCV 2024; Includes supplementary; 29 pages; 7 figures