中文

基于盒子引导的开放词汇 3D 场景实例分割检索

计算机视觉与模式识别 2025-12-23 v1

摘要

从场景级点云中定位和检索物体是一个在机器人和增强现实领域具有广泛应用前景的挑战性问题。这一任务通常被形式化为开放词汇 3D 实例分割。尽管最近的方法在性能方面表现突出,但它们高度依赖于 SAM 和 CLIP 来从随点云一起提供的图像中生成和分类 3D 实例掩码,导致计算开销大、处理速度慢,限制了其在实际场景中的部署。Open-YOLO 3D 通过使用实时 2D 检测器对预训练 3D 分段器直接从点云中产生的类别无关掩码进行分类,消除了对 SAM 和 CLIP 的需求,显著减少了推理时间。然而,Open-YOLO 3D 常常难以泛化到在 3D 训练数据中出现的频率较低的物体类别。本文提出了一种方法,通过 2D 开放词汇检测器引导从 RGB 图像中生成 novel objects 的 3D 实例掩码。该方法继承了 2D 检测器识别 novel objects 的能力,同时保持了高效的分类性能,实现了从开放式文本查询中对稀有实例的快速精准检索。我们的代码将在 https://github.com/ndkhanh360/BoxOVIS 发布。

关键词

引用

@article{arxiv.2512.19088,
  title  = {Retrieving Objects from 3D Scenes with Box-Guided Open-Vocabulary Instance Segmentation},
  author = {Khanh Nguyen and Dasith de Silva Edirimuni and Ghulam Mubashar Hassan and Ajmal Mian},
  journal= {arXiv preprint arXiv:2512.19088},
  year   = {2025}
}

备注

Accepted to AAAI 2026 Workshop on New Frontiers in Information Retrieval