TransVPR:基于Transformer且具有多级注意力聚合的地点识别方法
计算机视觉与模式识别
2022-04-14 v4
摘要
视觉地点识别对于自动驾驶导航和移动机器人定位等应用是一项具有挑战性的任务。复杂场景中存在干扰元素常导致视觉地点感知的偏差。为解决此问题,将仅来自任务相关区域的信息整合进图像表示至关重要。本文引入一种新颖的整体地点识别模型TransVPR,其基于视觉Transformer。它受益于Transformer中自注意力操作所具备的可自然聚合任务相关特征的良好特性。来自Transformer多个层级的注意力聚焦于不同的感兴趣区域,被进一步组合以生成全局图像表示。此外,由融合注意力掩码筛选出的Transformer层输出令牌被视为关键图像块描述子,用于执行空间匹配以对由全局图像特征检索出的候选者重新排序。整个模型允许以单一目标和图像级监督进行端到端训练。TransVPR在多个真实世界基准上取得最先进的性能,同时保持较低的计算时间与存储需求。
引用
@article{arxiv.2201.02001,
title = {TransVPR: Transformer-based place recognition with multi-level attention aggregation},
author = {Ruotong Wang and Yanqing Shen and Weiliang Zuo and Sanping Zhou and Nanning Zheng},
journal= {arXiv preprint arXiv:2201.02001},
year = {2022}
}
备注
CVPR 2022 oral