中文

面向自动驾驶的多模态数据高效 3D 场景理解

计算机视觉与模式识别 2025-12-08 v3 机器学习 机器人学

摘要

高效的数据利用对于推进自动驾驶中的 3D 场景理解至关重要,而对人工标注的 LiDAR 点云的严重依赖对全监督方法构成了挑战。为了解决这一问题,我们的研究扩展到了 LiDAR 语义分割的半监督学习,利用驾驶场景的内在空间先验和多传感器互补性来增强未标注数据集的有效性。我们引入了 LaserMix++,这是一个演进的框架,它整合了来自不同 LiDAR 扫描的激光束操作,并结合了 LiDAR-相机对应关系以进一步辅助数据高效学习。我们的框架通过引入多模态来增强 3D 场景一致性正则化,包括:1)用于细粒度跨传感器交互的多模态 LaserMix 操作;2)增强 LiDAR 特征学习的相机到 LiDAR 特征蒸馏;以及 3)使用开放词汇模型生成辅助监督的语言驱动知识指导。LaserMix++ 的多功能性使其适用于各种 LiDAR 表示,确立了其作为通用解决方案的地位。通过理论分析以及在流行驾驶感知数据集上的大量实验,我们的框架得到了严格验证。结果表明,LaserMix++ 显著优于全监督方法,在仅使用五分之一标注的情况下达到了相当的精度,并显著提升了仅监督基线。这一实质性进展突显了半监督方法在减少基于 LiDAR 的 3D 场景理解系统对大量标注数据依赖方面的潜力。

关键词

引用

@article{arxiv.2405.05258,
  title  = {Multi-Modal Data-Efficient 3D Scene Understanding for Autonomous Driving},
  author = {Lingdong Kong and Xiang Xu and Jiawei Ren and Wenwei Zhang and Liang Pan and Kai Chen and Wei Tsang Ooi and Ziwei Liu},
  journal= {arXiv preprint arXiv:2405.05258},
  year   = {2025}
}

备注

IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)