中文

ZoomNet:用于3D目标检测的部分感知自适应缩放神经网络

计算机视觉与模式识别 2020-03-03 v1

摘要

3D目标检测是自动驾驶和机器人技术中的一项基本任务。尽管已取得很大进展,在估计远处和被遮挡物体的3D姿态方面仍存在挑战。本文提出一种名为ZoomNet的基于立体图像的3D检测新框架。ZoomNet的流程始于一个普通的2D目标检测模型,用于获取左右边界框对。为进一步利用RGB图像中丰富的纹理线索以获得更精确的视差估计,我们引入了一个概念上直观的模块——自适应缩放,它同时将两个2D实例边界框调整为统一分辨率并相应调整相机内参。通过这种方式,我们能够从缩放后的边界框图像估计更高质量的视差图,进而为近处和远处物体构建稠密点云。此外,我们引入学习部分位置作为互补特征以提高对遮挡的鲁棒性,并提出3D拟合分数以更好地估计3D检测质量。在流行的KITTI 3D检测数据集上的大量实验表明,ZoomNet大幅超越所有先前的最先进方法(在APbv(IoU=0.7)上比pseudo-LiDAR提高9.4%)。消融研究也表明我们的自适应缩放策略在AP3d(IoU=0.7)上带来超过10%的提升。此外,由于官方KITTI基准缺乏像像素级部分位置这样的细粒度标注,我们还通过为KITTI增加详细的实例级标注(包括像素级部分位置、像素级视差等)提出了KFG数据集。KFG数据集和我们的代码将在 https://github.com/detectRecog/ZoomNet 公开可用。

关键词

引用

@article{arxiv.2003.00529,
  title  = {ZoomNet: Part-Aware Adaptive Zooming Neural Network for 3D Object Detection},
  author = {Zhenbo Xu and Wei Zhang and Xiaoqing Ye and Xiao Tan and Wei Yang and Shilei Wen and Errui Ding and Ajin Meng and Liusheng Huang},
  journal= {arXiv preprint arXiv:2003.00529},
  year   = {2020}
}

备注

Accpeted by AAAI 2020 as Oral presentation; The github page will be updated in March,2020