无需三维标注的开放词汇点云目标检测
计算机视觉与模式识别
2023-05-18 v2
摘要
开放词汇检测的目标是基于任意文本描述识别新颖物体。本文中,我们通过分而治之的策略解决开放词汇三维点云检测问题,该策略包括:1) 开发一个点云检测器,学习用于定位各类物体的通用表示;2) 连接文本与点云表示,使检测器能够基于文本提示对新颖物体类别进行分类。具体而言,我们利用丰富的图像预训练模型,使点云检测器在来自二维预训练检测器的预测二维边界框监督下学习定位物体。此外,我们提出一种新颖的去偏三元组跨模态对比学习来连接图像、点云与文本模态,从而使点云检测器受益于视觉-语言预训练模型,即 CLIP。这种将图像与视觉-语言预训练模型用于点云检测器的全新做法,使得开放词汇三维目标检测无需三维标注成为可能。实验表明,所提方法在 ScanNet 与 SUN RGB-D 数据集上分别比广泛的基线至少提升 3.03 点与 7.47 点。此外,我们提供了全面的分析以解释我们的方法为何有效。
引用
@article{arxiv.2304.00788,
title = {Open-Vocabulary Point-Cloud Object Detection without 3D Annotation},
author = {Yuheng Lu and Chenfeng Xu and Xiaobao Wei and Xiaodong Xie and Masayoshi Tomizuka and Kurt Keutzer and Shanghang Zhang},
journal= {arXiv preprint arXiv:2304.00788},
year = {2023}
}
备注
I want to update this manuscript