车辆-场景相互作用:面向自动驾驶的文本驱动 3D 激光点云位置识别方法
计算机视觉与模式识别
2025-10-06 v3
摘要
基于环境描述构建的大规模点云地图中的位置描述式定位对于推动大规模自动系统(如在末端配送中运行的配送机器人)的发展至关重要。然而,当前方法面临点云编码器无法有效捕获局部细节和长程空间关系,以及文本与点云表示之间显著模态差距的挑战。为此,本文提出 Des4Pos,一种新颖的两阶段文本驱动遥感定位框架。在粗略阶段,点云编码器利用多尺度融合注意力机制(MFAM)增强局部几何特征,随后通过双向长短期记忆(LSTM)模块强化全局空间关系。同时,阶梯文本编码器(STE)整合来自 CLIP 的跨模态先验知识,并通过该先验知识对齐文本与点云特征,有效弥合模态差距。在细化阶段,本文引入级联残差注意力(CRA)模块,以融合跨模态特征并预测相对位置偏移,从而实现更高的定位精度。在 KITTI360Pose 测试集上的实验表明,Des4Pos 在文本到点云位置识别中实现了最先进的性能。具体而言,在 5 米半径阈值下,Top-1 正确率达 40%,Top-10 正确率达 77%,分别超过最佳现有方法 7% 和 7%。
引用
@article{arxiv.2503.18035,
title = {Vehicle-Scene Interaction: A Text-Driven 3D Lidar Place Recognition Method for Autonomous Driving},
author = {Tianyi Shang and Zhenyu Li and Pengjie Xu and Zhaojun Deng},
journal= {arXiv preprint arXiv:2503.18035},
year = {2025}
}
备注
13 pages