中文

基于概念的可解释数据挖掘与VLM用于3D检测

计算机视觉与模式识别 2025-12-08 v1

摘要

稀有物体检测仍然是自动驾驶系统中的具有挑战性的任务,特别是当仅依赖点云数据时。虽然视觉-语言模型(VLMs)在图像理解方面表现出强大能力,但它们通过智能数据挖掘增强3D物体检测的潜力尚未被充分探索。本文提出了一种新颖的跨模态框架,利用2D VLMs从驾驶场景中识别和挖掘稀有物体,从而提高3D物体检测性能。我们的方法综合了物体检测、语义特征提取、降维和多方面异常检测等互补技术,形成一个连贯的、可解释的流水线,系统地识别驾驶场景中稀有但关键的物体。通过将隔离森林和基于t-SNE的异常检测方法与基于概念的过滤相结合,该框架有效地识别出语义上有意义的稀有物体。该方法的一个关键优势在于能够提取和标注目标稀有物体概念,如工程车辆、摩托车和路障。这大幅减少了标注负担,仅聚焦于最有价值的训练样本。在nuScenes数据集上的实验表明,这种概念引导的数据挖掘策略在仅使用部分训练数据的情况下增强了3D物体检测模型的性能,对于拖车和自行车等具有挑战性的物体类别相比等量随机数据有显著提升。这一发现对安全关键型自动驾驶系统中数据集的高效构建具有重大意义。

关键词

引用

@article{arxiv.2512.05482,
  title  = {Concept-based Explainable Data Mining with VLM for 3D Detection},
  author = {Mai Tsujimoto},
  journal= {arXiv preprint arXiv:2512.05482},
  year   = {2025}
}

备注

28 pages including appendix. Code: https://github.com/mm1129/concept_based_rare_detector_2025