基于视觉语言引导的激光雷达无监督 3D 对象检测
计算机视觉与模式识别
2024-08-08 v1
摘要
激光雷达点云中准确的 3D 对象检测是自动驾驶系统的关键。为实现最佳性能,监督式检测器的训练需要大量的人工标注数据,这些数据昂贵且仅限于预定义的对象类别。为缓解手动标注的 efforts,最近的无监督对象检测方法生成类无关的伪标签,随后用作检测器的监督信号。尽管取得了令人期待的结果,但这些方法不提供类别标签,或难以适用于静态对象。此外,它们大多局限于包含来自同一场景多个行驶的数据,或来自精确校准和同步相机设置的图像。为克服这些限制,我们提出一种基于视觉语言引导的无监督 3D 检测方法,仅使用激光雷达点云。我们将 CLIP 知识转移到静态和运动对象的点簇分类,利用激光雷达点云固有的时空信息进行聚类、跟踪以及框和标签的细化。我们的方法在Waymo Open数据集上超过最先进的无监督 3D 检测器 (+23 AP3D),在Argoverse 2上 (+7.9 AP3D),并提供类别标签,不仅基于对象大小假设,为该领域的进步标志性突破。
关键词
引用
@article{arxiv.2408.03790,
title = {Vision-Language Guidance for LiDAR-based Unsupervised 3D Object Detection},
author = {Christian Fruhwirth-Reisinger and Wei Lin and Dušan Malić and Horst Bischof and Horst Possegger},
journal= {arXiv preprint arXiv:2408.03790},
year = {2024}
}
备注
Accepted to BMVC 2024