面向Transformer时代的隐式聚合:用于车位识别的稳健图像表示
计算机视觉与模式识别
2026-01-19 v2
摘要
视觉车位识别(VPR)通常被视为特定的图像检索任务,其核心在于将图像表示为全局描述符。过去十年间,主导VPR方法(如NetVLAD)遵循一种范式:首先使用主干网络提取输入图像的patch特征/标记,然后通过聚合器将这些patch特征聚合为全局描述符。该主干+聚合器范式在CNN时代取得压倒性优势,至今仍广泛应用于基于Transformer的模型中。本文认为,在Transformer时代,不需要专门的聚合器,即仅凭主干网络即可获得稳健的全局描述符。具体而言,我们引入一些可学习的聚合标记,在特定Transformer模块之前将其拼接到patch标记上。所有这些标记都将通过内在的自注意力机制进行全局处理,隐式地将patch标记中有用的信息聚合到聚合标记中。最后,我们仅取最后一个输出标记中的这些聚合标记并拼接作为全局表示。虽然隐式聚合以极其简单的方式可以提供稳健的全局描述符,但关于在何处插入额外标记以及标记的初始化方式,仍是一个值得进一步探索的开放问题。为此,我们还提出了最优的标记插入策略和由经验研究派生的标记初始化方法。实验结果表明,我们的方法在多个VPR数据集上超越了最先进的方法,效率更高,在MSLS挑战赛排名第1。代码可在https://github.com/lu-feng/image获取。
引用
@article{arxiv.2511.06024,
title = {Towards Implicit Aggregation: Robust Image Representation for Place Recognition in the Transformer Era},
author = {Feng Lu and Tong Jin and Canming Ye and Yunpeng Liu and Xiangyuan Lan and Chun Yuan},
journal= {arXiv preprint arXiv:2511.06024},
year = {2026}
}
备注
Accepted by NeurIPS 2025