中文

面向自动驾驶的半监督视觉中心3D占据世界模型

计算机视觉与模式识别 2025-02-12 v1

摘要

理解世界动态对规划至关重要。近期方法试图通过学习3D占据世界模型来实现基于当前观察预测未来周围场景的能力,但仍需3D占据标签才能取得佳绩。鉴于户外场景3D标注成本高昂,我们提出一种半监督视觉中心3D占据世界模型PreWorld,通过 novel 双阶段训练范式充分利用2D标签的潜力:自监督预训练阶段和全监督微调阶段。在预训练阶段,我们利用属性投影头生成场景的不同属性场(如RGB、密度、语义),从而通过体渲染技术从2D标签获取时序监督。此外,我们引入一种简单而有效的状态条件预测模块,递归方式直接预测未来占据和自车轨迹。大量实验在nuScenes数据集上验证了我们方法的有效性和可扩展性,证明PreWorld在3D占据预测、4D占据预测和运动规划任务上均达到竞争性能。

关键词

引用

@article{arxiv.2502.07309,
  title  = {Semi-Supervised Vision-Centric 3D Occupancy World Model for Autonomous Driving},
  author = {Xiang Li and Pengfei Li and Yupeng Zheng and Wei Sun and Yan Wang and Yilun Chen},
  journal= {arXiv preprint arXiv:2502.07309},
  year   = {2025}
}

备注

Accepted by ICLR 2025