中文

Auto-Vocabulary 3D 目标检测

计算机视觉与模式识别 2025-12-19 v1

摘要

开放词汇 3D 目标检测方法能够定位训练期间未见的类的 3D 边界框。尽管得名开放词汇,现有方法在训练和推理期间仍依赖用户指定的类。我们提出研究 Auto-Vocabulary 3D 目标检测 (AV3DOD),即检测到的对象类自动生成,且无需任何用户输入。为此,我们引入语义得分 (SS) 以评估生成类名的质量。随后,我们开发了一种新框架 AV3DOD,该框架利用 2D 视觉语言模型 (VLMs) 通过图像描述生成丰富的语义候选项,进行伪 3D 边界框生成和特征空间语义扩展。AV3DOD 在 ScanNetV2 和 SUNRGB-D 数据集上在局部化 (mAP) 和语义质量 (SS) 方面均实现了最新水平。值得注意的是,它相较于最新方法 CoDA 提升了 3.48 的整体 mAP,并在 ScanNetV2 上实现了 24.5% 的相对 SS 提升。

关键词

引用

@article{arxiv.2512.16077,
  title  = {Auto-Vocabulary 3D Object Detection},
  author = {Haomeng Zhang and Kuan-Chuan Peng and Suhas Lohit and Raymond A. Yeh},
  journal= {arXiv preprint arXiv:2512.16077},
  year   = {2025}
}

备注

technical report