中文

VPFNet:用于多类三维目标检测的体素-像素融合网络

计算机视觉与模式识别 2021-11-02 v1 人工智能 机器学习 机器人学

摘要

许多基于 LiDAR 的方法在检测大物体、单类目标检测或简单场景下声称表现良好。然而,由于未能利用图像语义,其在小物体检测或困难场景下的性能未超越基于融合的方法。为提升复杂环境下的检测性能,本文提出一种嵌入深度学习(DL)的基于融合的多类三维目标检测网络,该网络同时接收 LiDAR 与相机传感器数据流,称为体素-像素融合网络(VPFNet)。该网络内部的一个关键新颖组件称为体素-像素融合(VPF)层,其利用体素-像素对的几何关系,以恰当机制融合体素特征与像素特征。此外,在考虑体素-像素对特性的基础上,特别设计了若干参数以引导和增强融合效果。最后,所提方法在 KITTI 基准上针对多级难度下的多类三维目标检测任务进行了评估,并在平均精度均值(mAP)上优于所有最先进方法。同样值得注意的是,我们的方法在 KITTI 排行榜上最具挑战性的行人类中排名第一。

关键词

引用

@article{arxiv.2111.00966,
  title  = {VPFNet: Voxel-Pixel Fusion Network for Multi-class 3D Object Detection},
  author = {Chia-Hung Wang and Hsueh-Wei Chen and Li-Chen Fu},
  journal= {arXiv preprint arXiv:2111.00966},
  year   = {2021}
}