中文

ViT-BEVSeg:一种用于单目鸟瞰图分割的分层 Transformer 网络

计算机视觉与模式识别 2022-06-01 v1

摘要

生成环境详细的近场感知模型是自动驾驶车辆与自主移动机器人领域中一个重要且具挑战性的问题。鸟瞰图(BEV)地图提供全景表示,是一种常用方法,可为车辆周边提供简化的 2D 表示,并具有准确的语义级分割以服务于许多下游任务。当前生成 BEV 地图的最优方法采用卷积神经网络(CNN)骨干网络创建特征图,并通过空间变换器将所得特征投影到 BEV 坐标系。本文中,我们评估使用视觉 Transformer(ViT)作为骨干架构来生成 BEV 地图。我们的网络架构 ViT-BEVSeg 采用标准视觉 Transformer 生成输入图像的多尺度表示,所得表示随后作为空间变换器解码器模块的输入,该模块输出 BEV 网格中的分割图。我们在 nuScenes 数据集上评估了我们的方法,相对于最优方法表现出显著的性能提升。

关键词

引用

@article{arxiv.2205.15667,
  title  = {ViT-BEVSeg: A Hierarchical Transformer Network for Monocular Birds-Eye-View Segmentation},
  author = {Pramit Dutta and Ganesh Sistu and Senthil Yogamani and Edgar Galván and John McDonald},
  journal= {arXiv preprint arXiv:2205.15667},
  year   = {2022}
}

备注

Accepted for 2022 IEEE World Congress on Computational Intelligence (Track: IJCNN)