中文

深入探究单目三维目标检测的自预训练范式

计算机视觉与模式识别 2022-06-16 v2

摘要

单目三维目标检测(M3OD)的标注获取成本高昂。同时,在实际应用中通常存在大量无标注数据,而预训练是利用无标注数据中知识的高效途径。然而,针对 M3OD 的预训练范式鲜有研究。本文旨在弥补这一空白。为此,我们首先得出两点观察:(1)设计预训练任务的准则是模仿目标任务的表征。(2)将深度估计与二维目标检测相结合是一个有前景的 M3OD 预训练基线。随后,遵循该准则,我们提出若干策略以进一步提升该基线,主要包括目标引导的半稠密深度估计、关键点感知的二维目标检测以及类别级损失调整。结合所有已开发的技术,所获得的预训练框架生成的预训练骨干网络在 KITTI-3D 与 nuScenes 基准上显著提升了 M3OD 性能。例如,将 DLA34 骨干网络应用于朴素的基于中心的 M3OD 检测器时,KITTI-3D 测试集上 Car 的 moderate AP3D70{\rm AP}_{3D}70 分数相对提升了 18.71%,nuScenes 验证集上的 NDS 分数相对提升了 40.41%。

关键词

引用

@article{arxiv.2206.03657,
  title  = {Delving into the Pre-training Paradigm of Monocular 3D Object Detection},
  author = {Zhuoling Li and Chuanrui Zhang and En Yu and Haoqian Wang},
  journal= {arXiv preprint arXiv:2206.03657},
  year   = {2022}
}