中文

面向灵活视觉姿态识别:加权聚合与标记裁剪

计算机视觉与模式识别 2026-05-21 v1 人工智能 机器人学

摘要

视觉姿态识别 (VPR) 旨在将查询图像匹配到大型数据库中同一位置的参考图像。近期的前沿方法采用视觉变换器 (ViT) 作为骨干网络提取具有鲁棒性的 patch 级特征,能够抵抗视角、照明和季节变化,然后聚合为紧凑的全局描述子以进行检索。大多数现有聚合方法在聚类中统一池化 patch 标记,尽管不同聚类往往编码不同的空间或语义模式且对 VPR 性能贡献不等。为此,我们提出加权聚合描述子 (WeiAD),在聚合过程中为聚类分配权重,产生更具辨识力的全局表示。除了准确性外,检索延迟也是大规模部署和资源受限边缘设备的关键关切。先前工作主要通过压缩全局描述子来降低延迟,忽略了特征提取成本的问题,这在 ViT 基础骨干网络中尤为突出。我们因此引入 WeiToP,一种面向 VPR 的标记裁剪框架,通过自教练实现降低特征提取成本,其中聚合引发的标记重要性监督一个轻量级裁剪模块附着在早期变换器层,实现推理时灵活的标记裁剪。在完成单个联合训练阶段后,WeiToP 使标记裁剪在推理时即插即用,允许在准确性与效率之间实现灵活的按需权衡,无需额外训练。此外,WeiToP 在视觉任务通用标记裁剪方法基础上表现优异。

关键词

引用

@article{arxiv.2605.20551,
  title  = {Faster or Stronger: Towards Flexible Visual Place Recognition via Weighted Aggregation and Token Pruning},
  author = {Zichao Zeng and June Moh Goo and Junwei Zheng and Weijia Fan and Jiaming Zhang and Rainer Stiefelhagen and Jan Boehm},
  journal= {arXiv preprint arXiv:2605.20551},
  year   = {2026}
}