中文

FM-OV3D:基于基础模型的跨模态知识融合用于开放词汇3D检测

计算机视觉与模式识别 2023-12-25 v1

摘要

预训练基础模型在各种视觉任务中的优越性能凸显了其增强2D模型开放词汇能力的潜力。现有方法探索了3D空间中的类似应用。然而,大多数方法仅集中于从单一基础模型中提取知识,这限制了3D模型的开放词汇能力。我们假设利用来自不同基础模型的互补预训练知识可以改善从2D预训练视觉语言模型到3D空间的知识迁移。在这项工作中,我们提出了FM-OV3D,一种基于基础模型的跨模态知识融合方法用于开放词汇3D检测,通过融合多个预训练基础模型的知识来提升3D模型的开放词汇定位和识别能力,实现真正的开放词汇而不受原始3D数据集的约束。具体来说,为了学习开放词汇3D定位能力,我们采用了Grounded-Segment-Anything模型的开放词汇定位知识。对于开放词汇3D识别能力,我们利用了生成式基础模型(包括GPT-3和Stable Diffusion模型)以及跨模态判别模型(如CLIP)的知识。在两个流行的开放词汇3D目标检测基准上的实验结果表明,我们的模型有效地从多个基础模型中学习知识以增强3D模型的开放词汇能力,并成功在开放词汇3D目标检测任务中达到了最先进的性能。代码发布于https://github.com/dmzhang0425/FM-OV3D.git。

关键词

引用

@article{arxiv.2312.14465,
  title  = {FM-OV3D: Foundation Model-based Cross-modal Knowledge Blending for Open-Vocabulary 3D Detection},
  author = {Dongmei Zhang and Chang Li and Ray Zhang and Shenghao Xie and Wei Xue and Xiaodong Xie and Shanghang Zhang},
  journal= {arXiv preprint arXiv:2312.14465},
  year   = {2023}
}

备注

Accepted by AAAI 2024. Code will be released at https://github.com/dmzhang0425/FM-OV3D.git