中文

面向通用场景的几何感知弱监督 3D 对象检测

计算机视觉与模式识别 2024-07-19 v1

摘要

3D 对象检测是场景理解不可或缺的组成部分。然而,对大规模 3D 数据集进行标注需要巨大的人力成本。为此,许多方法采用弱监督 3D 对象检测,通过利用 2D 边界框和场景/类别特定的先验信息来估计 3D 边界框。然而,这些方法通常依赖于复杂的人工先验,这些先验难以推广到新类别和场景。本文致力于提出一种通用方法,可以轻松适应新的场景和/或类别。我们发展了一个统一框架,用于从 RGB 图像和关联的 2D 边界框学习 3D 对象检测器。具体而言,我们提出了三个通用组件:先验注入模块用于从 LLM 模型中获取通用对象几何先验,2D 空间投影约束用于最小化投影到图像平面上的 3D 边界框边界与其对应 2D 边界框之间的差异,以及 3D 空间几何约束用于构建 Point-to-Box 对齐损失,以进一步细化估计的 3D 边界框姿态。在 KITTI 和 SUN-RGBD 数据集上进行实验表明,我们的方法仅需 2D 标注即可获得令人惊讶的高质量 3D 边界框。源代码可在 https://github.com/gwenzhang/GGA 获取。

关键词

引用

@article{arxiv.2407.13748,
  title  = {General Geometry-aware Weakly Supervised 3D Object Detection},
  author = {Guowen Zhang and Junsong Fan and Liyi Chen and Zhaoxiang Zhang and Zhen Lei and Lei Zhang},
  journal= {arXiv preprint arXiv:2407.13748},
  year   = {2024}
}

备注

Accepted to ECCV24