中文

MASS:面向稠密俯视理解的多注意力 LiDAR 数据语义分割模型

计算机视觉与模式识别 2022-01-21 v2 机器人学

摘要

所有自动驾驶系统的核心都是感知周围环境的能力,例如通过对 LiDAR 序列的语义分割,随着 SemanticKITTI 和 nuScenes-LidarSeg 等大型数据集的发布,该任务取得了显著进展。虽然多数先前工作聚焦于 LiDAR 输入的稀疏分割,稠密输出掩码为自动驾驶汽车提供了近乎完整的环境信息。本文中,我们提出 MASS——一个专为驾驶场景稠密俯视理解而构建的多注意力语义分割(Multi-Attentional Semantic Segmentation)模型。我们的框架作用于柱体(pillar)与占据(occupancy)特征,并包含三个基于注意力的构建模块:(1) 关键点驱动的图注意力,(2) 由空间输入的向量嵌入计算的基于 LSTM 的注意力,以及 (3) 基于柱体的注意力,从而生成稠密的 360 度分割掩码。通过在 SemanticKITTI 与 nuScenes-LidarSeg 上的大量实验,我们从定量上证明了模型的有效性:在 SemanticKITTI 上以 19.0% 超越 SOTA,在 nuScenes-LidarSeg 上达到 30.4% mIoU,其中 MASS 是首个处理稠密分割任务的工作。此外,我们的多注意力模型在 KITTI-3D 数据集上验证对 3D 目标检测非常有效,展示了其对 3D 视觉相关其他任务的高泛化性。

关键词

引用

@article{arxiv.2107.00346,
  title  = {MASS: Multi-Attentional Semantic Segmentation of LiDAR Data for Dense Top-View Understanding},
  author = {Kunyu Peng and Juncong Fei and Kailun Yang and Alina Roitberg and Jiaming Zhang and Frank Bieder and Philipp Heidenreich and Christoph Stiller and Rainer Stiefelhagen},
  journal= {arXiv preprint arXiv:2107.00346},
  year   = {2022}
}

备注

Accepted to IEEE Transactions on Intelligent Transportation Systems (T-ITS). Code is publicly available at https://github.com/KPeng9510/MASS