中文

用于车载LiDAR目标检测的联合嵌入预测架构自监督表示学习

机器人学 2025-10-08 v2 计算机视觉与模式识别

摘要

最近,依赖大量未标记数据的自监督表示学习已被探索作为自动驾驶的预训练方法。然而,直接将流行的对比或生成方法应用于此问题是不够的,甚至可能导致负迁移。在本文中,我们提出了AD-L-JEPA,一种新颖的自监督预训练框架,采用联合嵌入预测架构(JEPA)用于车载LiDAR目标检测。与现有方法不同,AD-L-JEPA既不是生成式的也不是对比式的。我们的方法不是显式生成掩蔽区域,而是预测鸟瞰图嵌入以捕捉驾驶场景的多样性。此外,我们的方法通过使用显式方差正则化来避免表示崩溃,从而无需手动形成对比对。实验结果表明,在KITTI3D、Waymo和ONCE数据集上,LiDAR 3D目标检测下游任务一致改进,同时与最先进方法Occupancy-MAE相比,GPU小时数减少了1.9倍至2.7倍,GPU内存减少了2.8倍至4倍。值得注意的是,在最大的ONCE数据集上,在100K帧上预训练获得了1.61 mAP的提升,优于所有其他在100K或500K帧上预训练的方法;在500K帧上预训练获得了2.98 mAP的提升,优于所有其他在500K或1M帧上预训练的方法。AD-L-JEPA构成了第一个基于JEPA的自动驾驶预训练方法。它提供了更好的质量、更快、更节省GPU内存的自监督表示学习。AD-L-JEPA的源代码即将发布。

关键词

引用

@article{arxiv.2501.04969,
  title  = {Self-Supervised Representation Learning with Joint Embedding Predictive Architecture for Automotive LiDAR Object Detection},
  author = {Haoran Zhu and Zhenyuan Dong and Kristi Topollai and Beiyao Sha and Anna Choromanska},
  journal= {arXiv preprint arXiv:2501.04969},
  year   = {2025}
}