中文

通过投影建模学习几何引导深度估计的单目三维目标检测

计算机视觉与模式识别 2024-04-25 v2

摘要

作为自动驾驶的一项关键任务,三维目标检测近年来取得了很大进展。然而,由于深度估计性能不理想,单目三维目标检测仍是一个具有挑战性的问题。大多数现有单目方法通常直接回归场景深度,而忽略了深度与各种几何要素(如边界框尺寸、三维目标维度和目标姿态)之间的重要关系。本文提出通过投影建模学习几何引导的深度估计,以推进单目三维目标检测。具体而言,设计了一个在单目三维目标检测网络中对二维和三维深度预测进行投影建模的系统性几何公式。我们进一步实现并嵌入所提公式,以实现几何感知的深度表示学习,从而允许有效的二维与三维交互来提升深度估计。此外,我们通过解决二维标注与投影框之间的显著错位提供了一个强基线,以确保在使用所提几何公式时的鲁棒学习。在 KITTI 数据集上的实验表明,我们的方法在中等测试设置下,仅使用额外数据就将最先进的基于单目的方法的检测性能显著提升了 2.80%。模型和代码将在 https://github.com/YinminZhang/MonoGeo 发布。

关键词

引用

@article{arxiv.2107.13931,
  title  = {Learning Geometry-Guided Depth via Projective Modeling for Monocular 3D Object Detection},
  author = {Yinmin Zhang and Xinzhu Ma and Shuai Yi and Jun Hou and Zhihui Wang and Wanli Ouyang and Dan Xu},
  journal= {arXiv preprint arXiv:2107.13931},
  year   = {2024}
}

备注

16 pages, 11 figures