中文

基于图像级类别与去偏跨模态对比学习的开放词汇3D检测

计算机视觉与模式识别 2022-07-06 v1

摘要

当前点云检测方法由于泛化能力有限,难以检测真实世界中的开放词汇物体。此外,收集并完整标注包含众多类别物体的点云检测数据集极为费力且昂贵,导致现有点云数据集类别有限,并阻碍模型学习通用表征以实现开放词汇点云检测。据我们所知,我们是首个研究开放词汇3D点云检测问题的工作。我们并非寻求具有完整标签的点云数据集,而是借助ImageNet1K来拓宽点云检测器的词汇量。我们提出了OV-3DETIC,一种使用图像级类别监督的开放词汇3D检测器(Open-Vocabulary 3D DETector using Image-level Class supervision)。具体而言,我们利用图像模态用于识别和 Point-cloud 模态用于定位这两种模态,为未见类别生成伪标签。然后我们提出一种新颖的去偏跨模态对比学习方法,在训练期间将知识从图像模态迁移到点云模态。OV-3DETIC在不增加推理延迟的情况下,使点云检测器能够实现开放词汇检测。大量实验表明,所提出的OV-3DETIC在SUN-RGBD数据集和ScanNet数据集上分别通过广泛基线实现了至少10.77% mAP(绝对值)和9.56% mAP(绝对值)的提升。此外,我们进行了充分实验以阐明所提OV-3DETIC生效的原因。

关键词

引用

@article{arxiv.2207.01987,
  title  = {Open-Vocabulary 3D Detection via Image-level Class and Debiased Cross-modal Contrastive Learning},
  author = {Yuheng Lu and Chenfeng Xu and Xiaobao Wei and Xiaodong Xie and Masayoshi Tomizuka and Kurt Keutzer and Shanghang Zhang},
  journal= {arXiv preprint arXiv:2207.01987},
  year   = {2022}
}