中文

PI-RCNN:一种具有基于点的注意力连续卷积融合模块的高效多传感器三维目标检测器

计算机视觉与模式识别 2019-12-03 v3

摘要

激光雷达(LIDAR)点云与 RGB 图像对三维目标检测均极其重要。因此许多当前最优(state-of-the-art)的三维检测算法致力于有效融合这两类数据。然而,它们基于鸟瞰图(Birds Eye View,BEV)或体素格式的融合方法不够精确。本文提出一种名为基于点的注意力连续卷积融合(Point-based Attentive Cont-conv Fusion,PACF)模块的新型融合方法,其在三维点上直接融合多传感器特征。除连续卷积外,我们额外加入点池化(Point-Pooling)与注意力聚合(Attentive Aggregation)以使融合特征更具表现力。此外,基于 PACF 模块,我们提出一种称为点云-图像 RCNN(Pointcloud-Image RCNN,简称 PI-RCNN)的三维多传感器多任务网络,其处理图像分割与三维目标检测任务。PI-RCNN 采用分割子网络从图像中提取全分辨率语义特征图,随后通过强大的 PACF 模块融合多传感器特征。得益于 PACF 模块的有效性及分割模块提供的具表现力的语义特征,PI-RCNN 在三维目标检测上可大幅提升性能。我们在 KITTI 三维检测基准上验证了 PACF 模块与 PI-RCNN 的有效性,且我们的方法在三维 AP 指标上可达到当前最优(state-of-the-art)。

关键词

引用

@article{arxiv.1911.06084,
  title  = {PI-RCNN: An Efficient Multi-sensor 3D Object Detector with Point-based Attentive Cont-conv Fusion Module},
  author = {Liang Xie and Chao Xiang and Zhengxu Yu and Guodong Xu and Zheng Yang and Deng Cai and Xiaofei He},
  journal= {arXiv preprint arXiv:1911.06084},
  year   = {2019}
}

备注

8 pages, 5 figures