中文

OccSora:作为自动驾驶世界模拟器的4D占用生成模型

计算机视觉与模式识别 2024-05-31 v1 人工智能

摘要

理解3D场景的演化对于有效的自动驾驶至关重要。传统方法通过个体实例的运动来建模场景发展,而世界模型则作为生成式框架来描述一般场景动态。然而,大多数现有方法采用自回归框架进行下一令牌预测,这在建模长期时间演化方面效率低下。为解决此问题,我们提出基于扩散的4D占用生成模型OccSora,用于模拟自动驾驶中3D世界的发展。我们使用4D场景分词器获得紧凑的离散时空表示用于4D占用输入,并实现长序列占用视频的高质量重建。然后,我们在时空表示上学习扩散变换器,并以轨迹提示为条件生成4D占用。我们在广泛使用的nuScenes数据集上进行了大量实验,该数据集带有Occ3D占用标注。OccSora能够生成具有真实3D布局和时间一致性的16秒视频,展示了其理解驾驶场景空间和时间分布的能力。通过轨迹感知的4D生成,OccSora有潜力作为自动驾驶决策的世界模拟器。代码可在https://github.com/wzzheng/OccSora获取。

关键词

引用

@article{arxiv.2405.20337,
  title  = {OccSora: 4D Occupancy Generation Models as World Simulators for Autonomous Driving},
  author = {Lening Wang and Wenzhao Zheng and Yilong Ren and Han Jiang and Zhiyong Cui and Haiyang Yu and Jiwen Lu},
  journal= {arXiv preprint arXiv:2405.20337},
  year   = {2024}
}

备注

Code is available at: https://github.com/wzzheng/OccSora