中文

基于文本与图像全面指引的开放词汇 3D 目标检测

计算机视觉与模式识别 2024-07-18 v2 人工智能

摘要

开放词汇 3D 目标检测 (OV-3DDet) 旨在定位和识别任意新 3D 场景中出现的已见及未见目标类别。尽管语言和视觉基础模型在处理各种开放词汇任务方面取得了成功,但 OV-3DDet 因训练数据稀缺面临重大挑战。虽然已有初步尝试将视觉语言模型 (VLM) 知识融入 OV-3DDet 学习,但这些基础模型的潜力尚未得到充分发挥。本文通过利用语言和视觉基础模型,解锁文本与视觉智慧以解决开放词汇 3D 检测问题。我们利用视觉基础模型提供图像层面的指引以发现 3D 场景中的新类别。具体而言,我们采用目标检测视觉基础模型实现对图像中目标的零样发现,这作为初始种子和过滤指引以识别新型 3D 目标。此外,为将 3D 空间与强大的视觉语言空间对齐,我们引入分层对齐方法,在实例、类别和场景层面使用预训练 VLM 对齐 3D 特征空间。通过大量实验,我们展示在准确率和泛化性方面实现了显著提升,凸显基础模型在实际场景中推动开放词汇 3D 目标检测的潜力。

关键词

引用

@article{arxiv.2407.05256,
  title  = {Unlocking Textual and Visual Wisdom: Open-Vocabulary 3D Object Detection Enhanced by Comprehensive Guidance from Text and Image},
  author = {Pengkun Jiao and Na Zhao and Jingjing Chen and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2407.05256},
  year   = {2024}
}

备注

ECCV2024