MPTF-Net:基于激光雷达的多视图金字塔变换融合网络用于地点识别
计算机视觉与模式识别
2026-04-07 v1 机器人学
摘要
基于激光雷达的地点识别 (LPR) 是大规模 SLAM 系统中全局定位和环路闭合检测的关键技术。现有方法通常从 Range Image 或 BEV 表示构建全局描述子进行匹配。BEV 因其显式的 2D 空间布局编码和高效检索而被广泛采用。然而,传统 BEV 表示依赖于简单统计聚合,无法捕获细粒度几何结构,在复杂或重复环境中导致性能下降。为此,我们提出了 MPTF-Net,一种新型的多视图多尺度金字塔变换融合网络。我们的核心贡献是基于 Normal Distribution Transform 的多通道 BEV 编码,通过显式建模局部几何复杂度和强度分布,提供抗噪声的结构先验。为有效整合这些特征,我们开发了定制的金字塔变换模块,捕获 Range Image View (RIV) 与 NDT-BEV 在多个空间尺度上的跨视图相互关联。在 nuScenes、KITTI 和 NCLT 数据集上进行大量实验表明,MPTF-Net 实现了最先进的性能,特别是在 nuScenes 波士顿数据集上实现了 96.31% 的 Recall@1,同时保持仅 10.02 毫秒的推理延迟,极其适合用于实时自动无人系统。
引用
@article{arxiv.2604.04513,
title = {MPTF-Net: Multi-view Pyramid Transformer Fusion Network for LiDAR-based Place Recognition},
author = {Shuyuan Li and Zihang Wang and Xieyuanli Chen and Wenkai Zhu and Xiaoteng Fang and Peizhou Ni and Junhao Yang and Dong Kong},
journal= {arXiv preprint arXiv:2604.04513},
year = {2026}
}