中文

Just Add Geometry: 无需人工标注的梯度-free Open-Vocabulary 3D 检测

计算机视觉与模式识别 2025-07-21 v1 人工智能

摘要

现代 3D 目标检测数据集受限于狭窄的类别分类学和高昂的人工标注成本,限制了其在开放世界环境中的扩展能力。相比之下,2D 视觉-语言模型在 web 规模的图像-文本对上训练,展现出丰富的语义理解能力,支持通过自然语言提示实现开放词汇检测。在本工作中,我们利用 2D 基础模型的成熟度和类别多样性,实现无需任何人工标注 3D 标签的开放词汇 3D 目标检测。我们的管道使用 2D 视觉-语言检测器生成文本条件的提议,通过 SAM 分割并利用相机几何和 LiDAR 或单目伪深度投影回 3D。我们引入一种基于 DBSCAN 聚类和旋转卡尺的几何膨胀策略,以推断 3D 边界框,而无需训练。为模拟恶劣的真实世界条件,我们构建了 Pseudo-nuScenes,即增强雾气的、仅 RGB 的 nuScenes 数据集的变体。实验表明,我们的方法在包括基于 LiDAR 和纯 RGB-D 输入的多个设置中实现了具竞争力的定位性能,同时保持训练-free 和开放词汇。我们的结果凸显了 2D 基础模型在可扩展 3D 感知中的潜在价值。我们开源了代码和资源,地址为 https://github.com/atharv0goel/open-world-3D-det。

关键词

引用

@article{arxiv.2507.13363,
  title  = {Just Add Geometry: Gradient-Free Open-Vocabulary 3D Detection Without Human-in-the-Loop},
  author = {Atharv Goel and Mehar Khurana},
  journal= {arXiv preprint arXiv:2507.13363},
  year   = {2025}
}