BEV-Locator:一种基于多视角图像的端到端视觉语义定位网络
计算机视觉与模式识别
2022-11-29 v1 人工智能
摘要
准确的定位能力是自动驾驶的基础。传统的视觉定位框架使用几何模型处理语义地图匹配问题,依赖于复杂的参数调优,从而阻碍大规模部署。本文中,我们提出 BEV-Locator:一种使用多视角相机图像的端到端视觉语义定位神经网络。具体而言,一个视觉 BEV(鸟瞰图)编码器将多视角图像提取并展平到 BEV 空间。同时,语义地图特征被结构化地嵌入为地图查询序列。随后一个跨模型 transformer 关联 BEV 特征与语义地图查询。自车定位信息通过交叉注意力模块递归查询得出。最后,可通过解码 transformer 输出推断自车位姿。我们在大规模 nuScenes 和 Qcraft 数据集上评估所提方法。实验结果表明,BEV-Locator 能够在多种场景下估计车辆位姿,有效关联来自多视角图像与全局语义地图的跨模型信息。实验报告了令人满意的精度,横向、纵向平移和航向角的平均绝对误差分别为 0.052m、0.135m 和 0.251。
引用
@article{arxiv.2211.14927,
title = {BEV-Locator: An End-to-end Visual Semantic Localization Network Using Multi-View Images},
author = {Zhihuang Zhang and Meng Xu and Wenqiang Zhou and Tao Peng and Liang Li and Stefan Poslad},
journal= {arXiv preprint arXiv:2211.14927},
year = {2022}
}