通过蒸馏2D开放词汇分割模型实现无标注3D学习用于自动驾驶
计算机视觉与模式识别
2025-01-08 v3
摘要
点云数据标注被认为是自动驾驶领域的耗时且昂贵的任务,而无标注学习训练可通过从无标注数据中学习点云表示来避免标注工作。本文提出了AFOV(Annotation-Free Open-Vocabulary)框架,一个新颖的3D无标注方法,辅助由2D开放词汇分割模型提供支持。该方法包含两个阶段:第一阶段,我们创造性地整合了2D开放词汇模型的高质量文本和图像特征,提出了三模态对比预训练(Tri-Modal contrastive Pre-training, TMP)。第二阶段,利用点云与图像之间的空间映射生成伪标签,实现跨模态知识蒸馏。此外,我们引入近似平坦交互(Approximate Flat Interaction, AFI)以解决对齐过程中的噪声问题和标签混淆。为验证AFOV的优越性,我们在多个相关数据集上进行了大量实验。在无标注3D分割任务上,在nuScenes数据集上实现了47.73%的mIoU,超越了前所未有的3.13%的mIoU提升。同时,在nuScenes和SemanticKITTI上进行1%数据微调的性能,分别达到了51.75%和48.14%的mIoU,均显著优于所有以往预训练模型。
引用
@article{arxiv.2405.15286,
title = {3D Annotation-Free Learning by Distilling 2D Open-Vocabulary Segmentation Models for Autonomous Driving},
author = {Boyi Sun and Yuhang Liu and Xingxia Wang and Bin Tian and Long Chen and Fei-Yue Wang},
journal= {arXiv preprint arXiv:2405.15286},
year = {2025}
}
备注
15 pages, 7 figures, codes are available at https://github.com/sbysbysbys/AFOV