反射教师:基于不确定性度量的鸟瞰图半监督多模态 3D 目标检测
计算机视觉与模式识别
2024-12-06 v1
摘要
在自动驾驶的鸟瞰图(BEV)半监督 3D 目标检测(SSOD)中,伪标签技术已被证明具有优势,尤其是在标注数据有限的情况下。在现有文献中,指数移动平均(EMA)被用于学生网络对教师网络权重的调整。然而,这会导致教师网络发生灾难性遗忘。在本工作中,我们通过引入反射教师(Reflective Teacher)的新概念来解决这一问题,学生网络同时利用标注数据和伪标注数据进行训练,其知识通过正则化项逐步传递给教师网络,以确保先前知识的保留。此外,我们提出了几何感知 BEV 融合(GA-BEVFusion),用于高效对齐多模态 BEV 特征,从而减少相机和激光雷达两种模态之间的差异。这有助于将激光雷达点中嵌入的精确几何信息可靠地映射到空间先验,以从相机图像中提取语义信息。我们在 nuScenes 和 Waymo 数据集上的实验表明:1)在完全监督和半监督设置下均优于现有最先进方法;2)反射教师在 nuScenes 和 Waymo 数据集上分别仅需 25% 和 22% 的标注数据即可达到同等性能,而其他完全监督方法则使用了完整的标注数据集。
引用
@article{arxiv.2412.04337,
title = {Reflective Teacher: Semi-Supervised Multimodal 3D Object Detection in Bird's-Eye-View via Uncertainty Measure},
author = {Saheli Hazra and Sudip Das and Rohit Choudhary and Arindam Das and Ganesh Sistu and Ciaran Eising and Ujjwal Bhattacharya},
journal= {arXiv preprint arXiv:2412.04337},
year = {2024}
}