位姿即查询:基于 Transformers 的图像到 LiDAR 地图定位
机器人学
2023-05-09 v1 计算机视觉与模式识别
摘要
基于商用配置的高精度车辆定位是高级自动驾驶任务的关键技术。在 LiDAR 地图中使用单目相机进行定位是一种新兴方法,在成本与精度之间取得了有前景的平衡,但通过寻找跨模态传感器数据之间的对应来估计位姿具有挑战性,从而损害了定位精度。在本文中,我们通过提出一种新颖的基于 Transformer 的神经网络以端到端方式将 2D 图像配准到 3D LiDAR 地图,来解决该问题。位姿被隐式表示为称为位姿查询的高维特征向量,并可通过在提出的位姿估计 Transformer(POET)模块中使用注意力机制与从跨模态特征中检索的相关信息进行交互而迭代更新。此外,我们应用多假设聚合方法,通过对多个随机初始化的位姿查询进行并行优化来估计最终位姿,以降低网络不确定性。在公共基准上的全面分析与实验结果表明,所提出的图像到 LiDAR 地图定位网络在具有挑战性的跨模态定位任务中可达到最先进的性能。
引用
@article{arxiv.2305.04298,
title = {Poses as Queries: Image-to-LiDAR Map Localization with Transformers},
author = {Jinyu Miao and Kun Jiang and Yunlong Wang and Tuopu Wen and Zhongyang Xiao and Zheng Fu and Mengmeng Yang and Maolin Liu and Diange Yang},
journal= {arXiv preprint arXiv:2305.04298},
year = {2023}
}
备注
8 pages, 3 figures, 4 tables