中文

RangeViT:面向自动驾驶中三维语义分割的视觉Transformer

计算机视觉与模式识别 2023-04-26 v2 人工智能 机器学习

摘要

将室外 LiDAR 点云的语义分割视为二维问题(例如通过距离投影)是一种有效且流行的方法。这些基于投影的方法通常受益于快速计算,并且当与利用其他点云表示的技术结合时,可达到最先进的性能。如今,基于投影的方法利用 2D CNN,但计算机视觉的最新进展表明,视觉Transformer(ViT)已在许多基于图像的基准测试中取得了最先进的结果。在这项工作中,我们探究基于投影的三维语义分割方法是否能从这些 ViT 的最新改进中受益。我们给出了肯定的答案,但前提是将其与三个关键要素结合:(a) ViT 以难以训练而闻名,且需要大量训练数据来学习强大的表征。通过保持与 RGB 图像相同的骨干架构,我们可以利用在大型图像集合上长时间训练所获得的知识,这些图像比点云更易于获取和标注。我们在大型图像数据集上预训练的 ViT 达到了最佳结果。(b) 我们通过用定制的卷积词干替代经典的线性嵌入层,来弥补 ViT 缺乏归纳偏置的问题。(c) 我们通过卷积解码器以及从卷积词干到 ViT 的跳跃连接来细化逐像素预测,从而将卷积词干的低层但细粒度特征与 ViT 编码器的高层但粗粒度预测相结合。借助这些要素,我们表明我们的方法(称为 RangeViT)在 nuScenes 和 SemanticKITTI 上优于现有的基于投影的方法。代码可在 https://github.com/valeoai/rangevit 获取。

关键词

引用

@article{arxiv.2301.10222,
  title  = {RangeViT: Towards Vision Transformers for 3D Semantic Segmentation in Autonomous Driving},
  author = {Angelika Ando and Spyros Gidaris and Andrei Bursuc and Gilles Puy and Alexandre Boulch and Renaud Marlet},
  journal= {arXiv preprint arXiv:2301.10222},
  year   = {2023}
}

备注

CVPR 2023. Code at https://github.com/valeoai/rangevit