PlaceFormer:基于Transformer的多尺度图像块选择与融合视觉地点识别
计算机视觉与模式识别
2024-05-29 v2 机器人学
摘要
视觉地点识别是计算机视觉以及自主机器人与车辆领域中的一项具有挑战性的任务,旨在根据视觉输入识别一个位置或地点。当代视觉地点识别方法采用卷积神经网络,并利用图像内的每个区域进行地点识别任务。然而,图像中动态和干扰元素的存在可能会影响地点识别过程的有效性。因此,聚焦于图像中与任务相关的区域以提升识别效果具有重要意义。在本文中,我们提出了PlaceFormer,一种新颖的基于Transformer的视觉地点识别方法。PlaceFormer利用Transformer的图像块(patch)令牌创建全局图像描述符,然后用于图像检索。为了对检索到的图像进行重排序,PlaceFormer合并来自Transformer的图像块令牌以形成多尺度图像块。利用Transformer的自注意力机制,它选择与图像中任务相关区域对应的图像块。这些选定的图像块经过几何验证,生成不同图像块尺寸下的相似度分数。随后,来自每个图像块尺寸的空间分数被融合以产生最终的相似度分数。该分数随后用于对最初使用全局图像描述符检索到的图像进行重排序。在基准数据集上的大量实验表明,PlaceFormer在准确性和计算效率方面均优于几种最先进的方法,所需时间和内存更少。
引用
@article{arxiv.2401.13082,
title = {PlaceFormer: Transformer-based Visual Place Recognition using Multi-Scale Patch Selection and Fusion},
author = {Shyam Sundar Kannan and Byung-Cheol Min},
journal= {arXiv preprint arXiv:2401.13082},
year = {2024}
}
备注
Accepted for publication in Robotics and Automation Letters