中文

MonoJSG:面向单目3D目标检测的联合语义与几何代价体

计算机视觉与模式识别 2022-03-17 v1

摘要

由于2D-3D投影固有的不适定性,单目3D目标检测缺乏准确的深度恢复能力。尽管深度神经网络(DNN)能够从高层次学习特征中实现单目深度感知,但像素级线索通常由于深度卷积机制而被忽略。为了同时利用DNN中强大的特征表示和像素级几何约束,我们将单目目标深度估计重新表述为一个渐进式细化问题,并提出一种联合语义与几何代价体来建模深度误差。具体而言,我们首先利用神经网络学习目标位置、尺寸和稠密归一化3D目标坐标。基于目标深度,将稠密坐标块与相应目标特征一起重投影到图像空间,以联合语义与几何误差的方式构建代价体。最终深度通过将代价体输入细化网络获得,其中语义和几何误差的分布由直接深度监督正则化。通过细化框架有效缓解深度误差,我们在KITTI和Waymo数据集上均取得了最先进的成果。

关键词

引用

@article{arxiv.2203.08563,
  title  = {MonoJSG: Joint Semantic and Geometric Cost Volume for Monocular 3D Object Detection},
  author = {Qing Lian and Peiliang Li and Xiaozhi Chen},
  journal= {arXiv preprint arXiv:2203.08563},
  year   = {2022}
}

备注

Accepted to CVPR 2022