中文

OccWorld:面向自动驾驶学习3D占据世界模型

计算机视觉与模式识别 2023-11-28 v1 人工智能 机器学习

摘要

理解3D场景如何演化对于自动驾驶中的决策至关重要。大多数现有方法通过预测物体框的运动来实现这一点,无法捕捉更细粒度的场景信息。本文中,我们探索了一种在3D占据空间中学习世界模型OccWorld的新框架,以同时预测自车运动和周围场景的演化。我们提出基于3D占据而非3D边界框和分割图来学习世界模型,原因有三:1)表达性。3D占据可描述场景更细粒度的3D结构;2)高效性。3D占据更易获取(例如从稀疏LiDAR点);3)通用性。3D占据可适配视觉和LiDAR。为便于对世界演化建模,我们在3D占据上学习基于重建的场景分词器,以获得描述周围场景的离散场景令牌。然后我们采用类GPT的时空生成transformer来生成后续场景和自车令牌,以解码未来占据和自车轨迹。在广泛使用的nuScenes基准上的大量实验证明了OccWorld有效建模驾驶场景演化的能力。OccWorld在不使用实例和地图监督的情况下也产生了具有竞争力的规划结果。代码:https://github.com/wzzheng/OccWorld。

关键词

引用

@article{arxiv.2311.16038,
  title  = {OccWorld: Learning a 3D Occupancy World Model for Autonomous Driving},
  author = {Wenzhao Zheng and Weiliang Chen and Yuanhui Huang and Borui Zhang and Yueqi Duan and Jiwen Lu},
  journal= {arXiv preprint arXiv:2311.16038},
  year   = {2023}
}

备注

Code is available at: https://github.com/wzzheng/OccWorld