中文

LidarMultiNet:面向激光雷达感知的统一多任务网络

计算机视觉与模式识别 2023-03-23 v2

摘要

基于激光雷达的3D目标检测、语义分割和全景分割通常在具有不同架构的专用网络中实现,这些架构难以相互适配。本文提出LidarMultiNet,一种基于激光雷达的多任务网络,统一了这三项主要激光雷达感知任务。多任务网络的诸多优势之一是通过在多个任务间共享权重与计算来降低总体成本。然而,其性能通常逊于独立组合的单任务模型。所提出的LidarMultiNet旨在弥合多任务网络与多个单任务网络之间的性能差距。LidarMultiNet的核心是一个强大的基于3D体素的编码器-解码器架构,带有全局上下文池化(Global Context Pooling, GCP)模块,从激光雷达帧中提取全局上下文特征。在网络顶部添加任务特定头以执行三项激光雷达感知任务。更多任务只需添加新任务特定头即可实现,且几乎不引入额外成本。还提出了第二阶段以细化第一阶段分割并生成准确的全景分割结果。LidarMultiNet在Waymo Open Dataset和nuScenes数据集上进行了广泛测试,首次证明主要激光雷达感知任务可统一于单一强网络中,该网络端到端训练并达到最先进性能。值得注意的是,LidarMultiNet在Waymo Open Dataset 2022年3D语义分割挑战赛中以最高mIoU和测试集上22个类别中绝大多数最佳精度获得官方第一名,仅使用激光雷达点作为输入。它还在Waymo 3D目标检测基准和三项nuScenes基准上树立了单模型的新最先进水平。

关键词

引用

@article{arxiv.2209.09385,
  title  = {LidarMultiNet: Towards a Unified Multi-Task Network for LiDAR Perception},
  author = {Dongqiangzi Ye and Zixiang Zhou and Weijia Chen and Yufei Xie and Yu Wang and Panqu Wang and Hassan Foroosh},
  journal= {arXiv preprint arXiv:2209.09385},
  year   = {2023}
}

备注

Accepted to AAAI 2023 (Oral). Full-length paper extending our previous technical report of the 1st place solution of the 2022 Waymo Open Dataset 3D Semantic Segmentation challenge, including evaluations on 5 major benchmarks. arXiv admin note: text overlap with arXiv:2206.11428