中文

基于结构先验挖掘与自提升学习的实例感知多相机三维目标检测

计算机视觉与模式识别 2023-12-14 v1

摘要

基于相机的鸟瞰图(BEV)感知范式在自动驾驶领域取得了显著进展。在此范式下,精确的BEV表示构建依赖于对多相机图像进行可靠的深度估计。然而,现有方法穷举地预测每个像素的深度,并未优先考虑物体,而这些物体恰恰是在三维空间中需要检测的实体。为此,我们提出了IA-BEV,它将图像平面实例感知集成到基于BEV的检测器内的深度估计过程中。首先,提出了一种类别特定的结构先验挖掘方法,以增强单目深度生成的效能。此外,还提出了一种自提升学习策略,以鼓励模型在计算代价高昂的时间立体匹配中更加关注具有挑战性的物体。两者共同提供了先进的深度估计结果,用于构建高质量的BEV特征,从而有益于最终的三维检测。所提出的方法在具有挑战性的nuScenes基准上取得了最先进的性能,广泛的实验结果证明了我们设计的有效性。

关键词

引用

@article{arxiv.2312.08004,
  title  = {Instance-aware Multi-Camera 3D Object Detection with Structural Priors Mining and Self-Boosting Learning},
  author = {Yang Jiao and Zequn Jie and Shaoxiang Chen and Lechao Cheng and Jingjing Chen and Lin Ma and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2312.08004},
  year   = {2023}
}

备注

Accepted to AAAI 2024