中文

基于视觉语言引导的激光雷达无监督 3D 对象检测

计算机视觉与模式识别 2024-08-08 v1

摘要

激光雷达点云中准确的 3D 对象检测是自动驾驶系统的关键。为实现最佳性能,监督式检测器的训练需要大量的人工标注数据,这些数据昂贵且仅限于预定义的对象类别。为缓解手动标注的 efforts,最近的无监督对象检测方法生成类无关的伪标签,随后用作检测器的监督信号。尽管取得了令人期待的结果,但这些方法不提供类别标签,或难以适用于静态对象。此外,它们大多局限于包含来自同一场景多个行驶的数据,或来自精确校准和同步相机设置的图像。为克服这些限制,我们提出一种基于视觉语言引导的无监督 3D 检测方法,仅使用激光雷达点云。我们将 CLIP 知识转移到静态和运动对象的点簇分类,利用激光雷达点云固有的时空信息进行聚类、跟踪以及框和标签的细化。我们的方法在Waymo Open数据集上超过最先进的无监督 3D 检测器 (+23 AP3D),在Argoverse 2上 (+7.9 AP3D),并提供类别标签,不仅基于对象大小假设,为该领域的进步标志性突破。

关键词

引用

@article{arxiv.2408.03790,
  title  = {Vision-Language Guidance for LiDAR-based Unsupervised 3D Object Detection},
  author = {Christian Fruhwirth-Reisinger and Wei Lin and Dušan Malić and Horst Bischof and Horst Possegger},
  journal= {arXiv preprint arXiv:2408.03790},
  year   = {2024}
}

备注

Accepted to BMVC 2024