Open-YOLO 3D:面向快速精准的开放词汇 3D 实例分割
计算机视觉与模式识别
2025-02-14 v3
摘要
近期在开放词汇 3D 实例分割方面的研究表现出强大的潜力,但往往以推理速度慢和高计算需求为代价。这种高计算成本通常源于对3D CLIP特征的重度依赖,这些特征需要计算密集型的2D基础模型(如Segment Anything (SAM)和CLIP)进行多视角聚合以生成3D表示。因此,这阻碍了其在需要快速且精确预测的许多实际应用场景。为此,我们提出一种快速而精准的开放词汇 3D 实例分割方法,称为Open-YOLO 3D,通过仅利用来自多视角RGB图像的2D目标检测,实现开放词汇 3D 实例分割。我们通过为场景中的对象生成类别无关的3D掩码,并将其与文本提示关联来完成此任务。我们观察到,类别无关的3D点云实例的投影已经包含实例信息;因此,仅使用SAM可能仅导致冗余,从而不必要地增加推理时间。我们经验性地发现,使用2D目标检测以更快的方式匹配文本提示与3D掩码可以获得更好的性能。我们在两个基准数据集上验证了Open-YOLO 3D:ScanNet200和Replica,分别在两种情景下进行测试:(i) 使用真实掩码,其中需要给定目标提案的标签;(ii) 使用来自3D提案网络生成的类别无关3D提案。我们的Open-YOLO 3D在两个数据集上均实现了最先进的性能,相较于文献中最佳方法,速度提升了约。在ScanNet200验证集上,我们的Open-YOLO 3D实现了24.7%的平均精度(mAP),每场景处理时间为22秒。代码和模型已在github.com/aminebdj/OpenYOLO3D上提供。
引用
@article{arxiv.2406.02548,
title = {Open-YOLO 3D: Towards Fast and Accurate Open-Vocabulary 3D Instance Segmentation},
author = {Mohamed El Amine Boudjoghra and Angela Dai and Jean Lahoud and Hisham Cholakkal and Rao Muhammad Anwer and Salman Khan and Fahad Shahbaz Khan},
journal= {arXiv preprint arXiv:2406.02548},
year = {2025}
}
备注
ICLR 2025 (Oral)