中文

LargeAD:面向自动驾驶的大规模跨传感器数据预训练框架

计算机视觉与模式识别 2025-12-04 v3 机器学习 机器人学

摘要

最近的视觉基础模型(VFM)在2D视觉感知方面取得了显著进展,但其在3D场景理解中的潜力,尤其是在自动驾驶应用中,仍有待探索。本文介绍了LargeAD——一个用于跨越多样真实驾驶数据集进行大规模3D预训练的通用且可扩展框架。该框架利用VFM从2D图像中提取语义丰富的超像素,并与LiDAR点云对齐,以生成高质量的对比学习样本。这种对齐方式促进了跨模态特征学习,增强了2D与3D数据之间的语义一致性。我们引入了若干关键创新:(i) 基于VFM的超像素生成以实现细粒度语义表示,(ii) VFM辅助的对比学习策略以对齐多模态特征,(iii) 超点的时序一致性以维持跨时间的稳定表示,以及(iv) 多源数据预训练以泛化到各种LiDAR配置。我们的方法在基于LiDAR的分割和目标检测的线性探测和微调任务中相较于最先进的方法实现了显著提升。11个大规模多传感器数据集上的大量实验表明,我们在适应性、效率和鲁棒性方面具有优势,能够在真实世界的自动驾驶场景中实现出色的性能。

关键词

引用

@article{arxiv.2501.04005,
  title  = {LargeAD: Large-Scale Cross-Sensor Data Pretraining for Autonomous Driving},
  author = {Lingdong Kong and Xiang Xu and Youquan Liu and Jun Cen and Runnan Chen and Wenwei Zhang and Liang Pan and Kai Chen and Ziwei Liu},
  journal= {arXiv preprint arXiv:2501.04005},
  year   = {2025}
}

备注

IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)