LaRa:用于多相机鸟瞰图语义分割的潜表示与射线
计算机视觉与模式识别
2023-03-01 v2 人工智能
机器人学
摘要
自动驾驶领域的近期工作已广泛采用鸟瞰图(BEV)语义地图作为对世界的中间表示。这些 BEV 地图的在线预测涉及非平凡操作,例如多相机数据提取以及融合与投影到公共俯视图网格中。这通常通过易出错的几何操作(例如单目深度估计中的单应性或反投影)或在图像像素与 BEV 中像素之间进行昂贵的直接密集映射(例如使用 MLP 或注意力)来完成。在本工作中,我们提出“LaRa”,一种高效的编码器-解码器、基于 transformer 的模型,用于从多相机中进行车辆语义分割。我们的方法使用交叉注意力系统将多个传感器的信息聚合为一个紧凑而丰富的潜表示集合。这些潜表示在经过一系列自注意力块处理之后,通过第二次在 BEV 空间中的交叉注意力被重新投影。我们证明我们的模型在 nuScenes 上优于以往使用 transformer 的最佳工作。代码和训练好的模型可在 https://github.com/valeoai/LaRa 获取。
引用
@article{arxiv.2206.13294,
title = {LaRa: Latents and Rays for Multi-Camera Bird's-Eye-View Semantic Segmentation},
author = {Florent Bartoccioni and Éloi Zablocki and Andrei Bursuc and Patrick Pérez and Matthieu Cord and Karteek Alahari},
journal= {arXiv preprint arXiv:2206.13294},
year = {2023}
}