桥接文本与视觉:基于多视角文本-视觉注册的跨模态地点识别
计算机视觉与模式识别
2025-03-10 v2 机器人学
摘要
移动机器人需要具备先进的自然语言理解能力,才能准确识别位置并执行包裹递送等任务。然而,传统的视觉地点识别(VPR)方法仅依赖单一视角的视觉信息,无法解释人类语言描述。为克服这一挑战,我们提出了一种基于多视角(360度全景视野)文本-视觉注册方法,称为 Text4VPR,用于地点识别任务,这是首个仅利用文本描述来匹配图像数据库的方法。Text4VPR 采用冻结的 T5 语言模型提取全局文本嵌入。此外,它利用带温度系数的 Sinkhorn 算法将局部标记分配到其 respective 簇,从而聚合来自图像的视觉描述。在训练阶段,Text4VPR 强调单个文本-图像对之间的对齐,以实现精确的文本描述。在推理阶段,Text4VPR 使用级联交叉注意力余弦对齐(CCCA)来解决文本和图像组之间的内部不匹配。随后,Text4VPR 基于文本-图像组的描述进行精确的地点匹配。在Street360Loc 数据集上,我们创建的首个文本到图像 VPR 数据集,Text4VPR 建立了稳健的基线,实现了在5米半径范围内测试集上的领先的 top-1 准确率为57%和领先的 top-10 准确率为92%,这表明从文本描述到图像的定位不仅是可行的,而且在进一步发展方面具有重要潜力,如图1所示。
引用
@article{arxiv.2502.14195,
title = {Bridging Text and Vision: A Multi-View Text-Vision Registration Approach for Cross-Modal Place Recognition},
author = {Tianyi Shang and Zhenyu Li and Pengjie Xu and Jinwei Qiao and Gang Chen and Zihan Ruan and Weijun Hu},
journal= {arXiv preprint arXiv:2502.14195},
year = {2025}
}
备注
8 pages, 4 figures, conference