中文

每个数据集都重要:基于联合数据集训练扩展单目 3D 目标检测

计算机视觉与模式识别 2024-09-25 v4

摘要

单目 3D 目标检测在自动驾驶中起着关键作用。然而,现有单目 3D 检测算法依赖于由 LiDAR 测量得到的 3D 标签,获取新数据集成本高昂,且难以部署于新环境。具体而言,本研究探讨了在由 3D 与 2D 数据集构成的多样化集合上训练单目 3D 目标检测模型的流程。所提框架包含三个组件:(1) 能在不同相机设置下工作的鲁棒单目 3D 模型,(2) 适应具有不同类别标注数据集的选择性训练策略,以及 (3) 利用 2D 标签的伪 3D 训练方法,以提升仅含 2D 标签场景中的检测性能。借助该框架,我们可在联合的多种开放 3D/2D 数据集上训练模型,从而获得泛化能力显著更强、且在仅有 2D 标签的新数据集上性能增强的模型。我们在 KITTI/nuScenes/ONCE/Cityscapes/BDD100K 数据集上进行了大量实验,以证明所提方法的扩展能力。

关键词

引用

@article{arxiv.2310.00920,
  title  = {Every Dataset Counts: Scaling up Monocular 3D Object Detection with Joint Datasets Training},
  author = {Fulong Ma and Xiaoyang Yan and Guoyang Zhao and Xiaojie Xu and Yuxuan Liu and Jun Ma and Ming Liu},
  journal= {arXiv preprint arXiv:2310.00920},
  year   = {2024}
}