中文

UniPAD:一种面向自动驾驶的通用预训练范式

计算机视觉与模式识别 2024-04-09 v2

摘要

在自动驾驶背景下,有效特征学习的重要性被广泛认可。尽管传统 3D 自监督预训练方法已取得广泛成功,多数方法沿用了最初为 2D 图像设计的思路。本文中,我们提出 UniPAD,一种应用 3D 体素可微渲染的新颖自监督学习范式。UniPAD 隐式编码 3D 空间,促进连续 3D 形状结构及其 2D 投影复杂外观特征的重建。我们方法的灵活性使其能无缝集成至 2D 与 3D 框架,实现对场景更整体的理解。我们通过在多种下游 3D 任务上进行大量实验验证了 UniPAD 的可行性与有效性。我们的方法分别将基于 lidar、相机及 lidar-相机的基线显著提升 9.1、7.7 与 6.9 NDS。值得注意的是,我们的预训练流程在 nuScenes 验证集上取得 73.2 NDS 的 3D 目标检测成绩与 79.4 mIoU 的 3D 语义分割成绩,相较以往方法达到最先进结果。代码将发布于 https://github.com/Nightmare-n/UniPAD。

关键词

引用

@article{arxiv.2310.08370,
  title  = {UniPAD: A Universal Pre-training Paradigm for Autonomous Driving},
  author = {Honghui Yang and Sha Zhang and Di Huang and Xiaoyang Wu and Haoyi Zhu and Tong He and Shixiang Tang and Hengshuang Zhao and Qibo Qiu and Binbin Lin and Xiaofei He and Wanli Ouyang},
  journal= {arXiv preprint arXiv:2310.08370},
  year   = {2024}
}

备注

CVPR2024