中文

Find n' Propagate:城市环境中的开放词汇3D目标检测

计算机视觉与模式识别 2024-07-15 v2 人工智能

摘要

在这项工作中,我们解决了当前基于LiDAR的3D目标检测系统的局限性,这些系统受到受限的类别词汇和标注新目标类别的高昂成本的阻碍。我们对城市环境中开放词汇(OV)学习的探索,旨在利用预训练的视觉-语言模型(VLMs)和多传感器数据来捕获新实例。我们设计并基准测试了四种潜在的解决方案作为基线,根据其输入数据策略将它们归类为自上而下或自下而上的方法。虽然这些方法有效,但也表现出一定的局限性,例如在3D框估计中遗漏新物体,或应用严格的先验,导致偏向于靠近相机或具有矩形几何形状的物体。为了克服这些限制,我们为3D OV任务引入了一种通用的\textsc{Find n' Propagate}方法,旨在最大化新物体的召回率,并将这种检测能力传播到更远的区域,从而逐步捕获更多物体。具体来说,我们利用一个贪婪框搜索器在每个生成的视锥体内搜索不同方向和深度的3D新框,并通过交叉对齐和密度排序器确保新识别框的可靠性。此外,所提出的远程模拟器通过在自训练过程中随机多样化伪标记的新实例,并结合记忆库中基础样本的融合,缓解了对靠近相机的物体的固有偏差。大量实验表明,在不同的OV设置、VLMs和3D检测器中,新物体召回率提高了53%。值得注意的是,我们在新目标类别上的平均精度(AP)实现了高达3.97倍的提升。源代码已发布于https://github.com/djamahl99/findnpropagate。

关键词

引用

@article{arxiv.2403.13556,
  title  = {Find n' Propagate: Open-Vocabulary 3D Object Detection in Urban Environments},
  author = {Djamahl Etchegaray and Zi Huang and Tatsuya Harada and Yadan Luo},
  journal= {arXiv preprint arXiv:2403.13556},
  year   = {2024}
}

备注

To appear in ECCV 2024. Source code: https://github.com/djamahl99/findnpropagate