在占据世界中驾驶:基于世界模型的以视觉为中心的 4D 占据预测与自动驾驶规划
计算机视觉与模式识别
2025-01-20 v3
摘要
世界模型基于各种自车动作设想潜在的未来状态。它们嵌入了关于驾驶环境的丰富知识,促进了安全且可扩展的自动驾驶。现有大多数方法主要关注数据生成或世界模型的预训练范式。与上述先前工作不同,我们提出了 Drive-OccWorld,将一个以视觉为中心的 4D 预测世界模型适配于端到端自动驾驶规划。具体而言,我们首先在记忆模块中引入语义和运动条件归一化,从历史 BEV 嵌入中累积语义和动态信息。然后,考虑几何和时空建模,将这些 BEV 特征传送到世界解码器以进行未来占据和流预测。此外,我们提出将灵活的动作条件(如速度、转向角、轨迹和命令)注入世界模型,以实现可控生成并促进更广泛的下游应用。进一步地,我们探索将 4D 世界模型的生成能力与端到端规划相集成,从而能够连续预测未来状态并使用基于占据的代价函数选择最优轨迹。在 nuScenes、nuScenes-Occupancy 和 Lyft-Level5 数据集上进行的综合实验表明,我们的方法能够生成合理且可控的 4D 占据,为驾驶世界生成和端到端规划的进步铺平了道路。项目页面:https://drive-occworld.github.io/
引用
@article{arxiv.2408.14197,
title = {Driving in the Occupancy World: Vision-Centric 4D Occupancy Forecasting and Planning via World Models for Autonomous Driving},
author = {Yu Yang and Jianbiao Mei and Yukai Ma and Siliang Du and Wenqing Chen and Yijie Qian and Yuxiang Feng and Yong Liu},
journal= {arXiv preprint arXiv:2408.14197},
year = {2025}
}
备注
Accepted by AAAI2025