基于扩散模型的高质量开放世界 3D 检测框架:HQ-OV3D
计算机视觉与模式识别
2025-08-19 v2 机器学习
机器人学
摘要
传统的封闭式 3D 检测框架无法满足自动驾驶等开放世界应用的需求。现有的开放词汇 3D 检测方法通常采用由伪标签生成 followed by 语义对齐 两阶段管道。虽然视觉语言模型(Vision-Language Models, VLM)最近在提升伪标签的语义准确性方面取得了显著进展,但其几何质量,特别是边界框精度,常常被忽视。为此,我们提出一种 High Box Quality Open-Vocabulary 3D Detection(HQ-OV3D)框架,致力于为开放词汇类别生成和细化高质量的伪标签。该框架包含两个关键组件:一种 Intra-Modality Cross-Validated(IMCV)提议生成器,利用跨模态几何一致性生成高质量的初始 3D 提议;以及一种 Annotated-Class Assisted(ACA)去噪器,通过 DDIM 基于去噪机制利用标注类别的几何先验来逐步细化 3D 提议。与最先进的方法相比,使用我们方法生成的伪标签进行训练,可在 novel classes 上实现 mAP 提升 7.37%,显示示我们框架产生的伪标签质量优越。HQ-OV3D 不仅可以作为强大的独立开放词汇 3D 检测器,还可作为现有开放词汇检测或标注管道的可插拔式高质量伪标签生成器。
引用
@article{arxiv.2508.10935,
title = {HQ-OV3D: A High Box Quality Open-World 3D Detection Framework based on Diffision Model},
author = {Qi Liu and Yabei Li and Hongsong Wang and Lei He},
journal= {arXiv preprint arXiv:2508.10935},
year = {2025}
}