ImOV3D:仅从二维图像学习开放词汇点云三维目标检测
计算机视觉与模式识别
2024-11-19 v1
摘要
开放词汇三维目标检测(OV-3Det)旨在泛化到训练阶段标注的有限基础类别之外。其最大瓶颈在于三维标注数据的稀缺,而二维图像数据集则丰富且标注详尽。因此,一个直观的思路是利用二维图像中丰富的标注来缓解OV-3Det固有的数据稀缺问题。本文通过探索仅使用二维图像学习OV-3Det的潜力,将任务设定推向极限。该设定面临的主要挑战是训练图像与测试点云之间的模态鸿沟,这阻碍了二维知识有效融入OV-3Det。为应对这一挑战,我们提出了一种新颖的框架ImOV3D,利用包含图像和点云(PC)的伪多模态表示来弥合模态鸿沟。ImOV3D的关键在于灵活的模态转换,其中二维图像可通过单目深度估计提升至三维,也可通过渲染从三维场景中导出。这使得训练图像和测试点云都能统一到一种共同的图像-PC表示中,该表示既包含丰富的二维语义信息,也融合了三维空间数据的深度和结构特征。我们精心执行这种转换,以最小化训练与测试样本之间的领域差距。在SUNRGBD和ScanNet两个基准数据集上的大量实验表明,即使在没有真实三维训练数据的情况下,ImOV3D也显著优于现有方法。在加入少量真实三维数据进行微调后,其性能也显著超越了先前的最优水平。代码和预训练模型已在https://github.com/yangtiming/ImOV3D上发布。
引用
@article{arxiv.2410.24001,
title = {ImOV3D: Learning Open-Vocabulary Point Clouds 3D Object Detection from Only 2D Images},
author = {Timing Yang and Yuanliang Ju and Li Yi},
journal= {arXiv preprint arXiv:2410.24001},
year = {2024}
}
备注
Accepted by NeurIPS 2024. Code link https://github.com/yangtiming/ImOV3D