中文

基于解释的半监督3D目标检测:PatchTeacher与PillarMix

计算机视觉与模式识别 2024-07-16 v1

摘要

半监督学习旨在利用大量未标记数据提高模型性能。当前半监督3D目标检测方法通常使用教师模型为学生生成伪标签,伪标签的质量对最终性能至关重要。本文提出了PatchTeacher,专注于部分场景3D目标检测,为学生提供高质量的伪标签。具体而言,我们将完整场景划分为一系列补丁,依次输入我们的PatchTeacher。PatchTeacher利用部分场景检测的低内存消耗优势处理高分辨率体素化的点云,这可以最小化量化信息损失并提取更细粒度的特征。然而,在场景的片段上训练检测器并非易事。因此,我们引入三个关键技术,即Patch Normalizer、Quadrant Align和Fovea Selection,以提高PatchTeacher的性能。此外,我们设计了PillarMix,这是一种强大的数据增强策略,通过混合来自不同LiDAR扫描的被截断柱体来生成多样化的训练样本,从而帮助模型学习更通用的表征。在Waymo和ONCE数据集上进行的大量实验验证了我们方法的有效性和优越性,我们实现了新的SOTA结果,显著超越了现有方法。代码可在https://github.com/LittlePey/PTPM获取。

关键词

引用

@article{arxiv.2407.09787,
  title  = {Semi-supervised 3D Object Detection with PatchTeacher and PillarMix},
  author = {Xiaopei Wu and Liang Peng and Liang Xie and Yuenan Hou and Binbin Lin and Xiaoshui Huang and Haifeng Liu and Deng Cai and Wanli Ouyang},
  journal= {arXiv preprint arXiv:2407.09787},
  year   = {2024}
}

备注

Accepted by AAAI 2024