基于组合数据集的自监督预训练用于自动驾驶中的3D感知
计算机视觉与模式识别
2025-04-18 v1
摘要
大规模数据在自然语言处理和2D视觉领域取得的显著成就激发了我们探索大规模数据预训练为自动驾驶中3D感知潜力的研究。为此目标,我们提出利用来自异构数据集的大量无标签数据来预训练3D感知模型。我们引入一种从无标签数据从零开始学习有效3D表征的自监督预训练框架,结合基于prompt adapter的数据域适应策略以减少数据偏差。该方法显著提高了在下游任务(如3D目标检测、BEV分割、3D目标跟踪和占据预测)上的模型性能,并随训练数据量的增加呈现稳定的性能提升,展示了持续为自动驾驶的3D感知模型带来潜在益处的可能性。我们将公开源代码以激发社区进一步的调查。
引用
@article{arxiv.2504.12709,
title = {Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving},
author = {Shumin Wang and Zhuoran Yang and Lidian Wang and Zhipeng Tang and Heng Li and Lehan Pan and Sha Zhang and Jie Peng and Jianmin Ji and Yanyong Zhang},
journal= {arXiv preprint arXiv:2504.12709},
year = {2025}
}