中文

SGV3D:面向视觉路侧3D目标检测的场景泛化

计算机视觉与模式识别 2024-04-10 v2

摘要

路侧感知可以通过将自动驾驶车辆的感知能力扩展到视觉范围之外并解决盲点,从而大大提高其安全性。然而,当前最先进的基于视觉的路侧检测方法在标注场景上具有高精度,但在新场景上性能较差。这是因为路侧摄像头在安装后保持静止,只能从单个场景收集数据,导致算法过拟合这些路侧背景和相机姿态。为了解决这个问题,本文提出了一种创新的面向视觉路侧3D目标检测的场景泛化框架,称为SGV3D。具体来说,我们采用背景抑制模块(BSM)通过在从2D到鸟瞰图投影过程中衰减背景特征来减轻视觉中心流水线中的背景过拟合。此外,通过引入使用新场景未标注图像的半监督数据生成流水线(SSDG),生成了具有不同相机姿态的多样化实例前景,解决了特定相机姿态过拟合的风险。我们在两个大规模路侧基准上评估了我们的方法。我们的方法在新场景上显著超越了所有先前方法,包括在DAIR-V2X-I异源基准上,与BEVHeight相比,车辆提高了+42.57%,行人提高了+5.87%,骑行者提高了+14.89%。在更大规模的Rope3D异源基准上,我们在汽车上获得了14.48%的显著提升,在大型车辆上获得了12.41%的提升。我们希望为路侧感知技术的探索提供见解,强调其场景泛化能力。代码将在https://github.com/yanglei18/SGV3D提供。

关键词

引用

@article{arxiv.2401.16110,
  title  = {SGV3D:Towards Scenario Generalization for Vision-based Roadside 3D Object Detection},
  author = {Lei Yang and Xinyu Zhang and Jun Li and Li Wang and Chuang Zhang and Li Ju and Zhiwei Li and Yang Shen},
  journal= {arXiv preprint arXiv:2401.16110},
  year   = {2024}
}

备注

13 pages, 8 figures