中文

面向自动驾驶车辆的实时三维语义占用预测:基于内存高效稀疏卷积

机器人学 2024-05-21 v3 计算机视觉与模式识别

摘要

在自动驾驶车辆中,实时理解自车周围的三维环境至关重要。一种既能编码几何距离又能编码语义物体信息的紧凑场景表示方式是三维语义占用地图。当前最先进的三维建图方法利用具有交叉注意力机制的 Transformer 将二维视觉中心的相机特征提升到三维域。然而,这些方法在实时应用中面临重大挑战,因为它们在推理过程中计算需求很高。这一限制在自动驾驶车辆中尤为突出,因为 GPU 资源必须与定位和规划等其他任务共享。在本文中,我们引入了一种方法,从前视二维相机图像和激光雷达扫描中提取特征,然后采用稀疏卷积网络(Minkowski Engine)进行三维语义占用预测。鉴于自动驾驶场景中的室外场景本质上是稀疏的,使用稀疏卷积尤为合适。通过联合解决稀疏场景的三维场景补全和三维语义分割问题,我们提供了一个更高效的学习框架,适用于自动驾驶车辆中的实时应用。我们还在 nuScenes 数据集上展示了具有竞争力的准确率。

关键词

引用

@article{arxiv.2403.08748,
  title  = {Real-time 3D semantic occupancy prediction for autonomous vehicles using memory-efficient sparse convolution},
  author = {Samuel Sze and Lars Kunze},
  journal= {arXiv preprint arXiv:2403.08748},
  year   = {2024}
}

备注

8 pages, 7 figures