MambaPlace:基于注意力Mamba机制的文本到点云跨模态地点识别
计算机视觉与模式识别
2025-02-24 v3 机器人学
摘要
视觉语言地点识别 (VLVPR) 通过融合来自图像的自然语言描述来增强机器人定位性能。利用语言信息,VLVPR引导机器人进行地点匹配,克服仅依赖视觉的限制。跨模态融合的核心在于挖掘不同模态之间的互补信息。然而,通用的融合方法依赖于传统神经网络结构,难以捕捉跨模态相互作用的动态特性,尤其是在存在复杂的类内和类间相关性时。为此,本文提出一种新的粗到细且端到端连接的跨模态地点识别框架,称为MambaPlace。在粗略定位阶段,文本描述和3D点云分别通过预训练的T5和实例编码器进行编码。随后使用文本注意力Mamba (TAM) 和点云Mamba (PCM) 对数据进行增强和对齐。在后续的细化定位阶段,文本描述和3D点云的特征进行跨模态融合,并通过级联交叉注意力Mamba (CCAM) 进一步增强。最后,我们从融合后的文本点云特征中预测位置偏移量,实现最精确的定位。大量实验表明,MambaPlace在KITTI360Pose数据集上相对于领先的方法实现了 improved的定位精度。
关键词
引用
@article{arxiv.2408.15740,
title = {MambaPlace:Text-to-Point-Cloud Cross-Modal Place Recognition with Attention Mamba Mechanisms},
author = {Tianyi Shang and Zhenyu Li and Pengjie Xu and Jinwei Qiao},
journal= {arXiv preprint arXiv:2408.15740},
year = {2025}
}
备注
8 pages