中文

UniWorld:基于世界模型的自动驾驶预训练

计算机视觉与模式识别 2023-08-15 v1 机器人学

摘要

在本文中,我们受到 Alberto Elfes 1989 年开创性工作的启发,他引入了占据栅格作为机器人世界模型的概念。我们赋予机器人一个时空世界模型,称为 UniWorld,以感知其周围环境并预测其他参与者的未来行为。UniWorld 首先预测 4D 几何占据作为基础阶段的世界模型,随后在下游任务上进行微调。UniWorld 能够估计关于世界状态的缺失信息并预测合理的世界未来状态。此外,UniWorld 的预训练过程是无标签的,使得能够利用大量的图像-激光雷达对来构建基础模型。所提出的统一预训练框架在运动预测、多相机 3D 目标检测和周围语义场景补全等关键任务中展示了有前景的结果。与 nuScenes 数据集上的单目预训练方法相比,UniWorld 在运动预测的 IoU 上显著提升约 1.5%,在多相机 3D 目标检测的 mAP 和 NDS 上分别提升 2.0%,在周围语义场景补全的 mIoU 上提升 3%。通过采用我们的统一预训练方法,可实现 3D 训练标注成本降低 25%,为实际自动驾驶的实现提供了显著的实用价值。代码已公开于 https://github.com/chaytonmin/UniWorld。

关键词

引用

@article{arxiv.2308.07234,
  title  = {UniWorld: Autonomous Driving Pre-training via World Models},
  author = {Chen Min and Dawei Zhao and Liang Xiao and Yiming Nie and Bin Dai},
  journal= {arXiv preprint arXiv:2308.07234},
  year   = {2023}
}

备注

8 pages, 5 figures. arXiv admin note: substantial text overlap with arXiv:2305.18829