中文

稀疏世界模型:通过稀疏场景表示提升端到端自动驾驶

计算机视觉与模式识别 2026-05-26 v1

摘要

最近,世界模型在通过未来情景预测和改进场景理解方面取得了显著进展。然而,现有的驾驶世界模型通常基于稠密场景表示,导致高计算成本和冗余信息。本文提出了稀疏世界模型(SparseWorld),一种轻量级世界模型,专注于预测场景中关键布局,为端到端驾驶系统的高效未来预测提供支持。稀疏世界模型首先进行自回归展开,以预测未来地图元素和周围智能体,从而使模型学习驾驶情景随时间的演变。随后,它利用这些预测的未来情况来细化下游运动预测和轨迹规划。具体而言,我们提出了稀疏幻想者(Sparse Dreamer),通过联合时间和空间注意力在潜在空间中预测未来实例。通过与预测的未来实例交互,运动规划器捕获更准确的运动模式,生成更具信息性和安全性的轨迹。大量实验表明,稀疏世界模型显著降低了碰撞风险,在nuScenes数据集的开放式规划指标上实现了最佳性能,碰撞率为0.05%。此外,在Bench2Drive基准测试的闭合式规划指标上,它显著优于基线方法。补充材料可在项目页面获取:https://wryzju.github.io/SparseWorld/。

关键词

引用

@article{arxiv.2605.24354,
  title  = {SparseWorld: Enhancing End-to-End Autonomous Driving via World Models with Sparse Scene Representation},
  author = {Ruoyu Wang and Jingke Wang and Yukai Ma and Yuehao Huang and Shuangming Lei and Guanglin Xu and Aixue Ye and Yong Liu},
  journal= {arXiv preprint arXiv:2605.24354},
  year   = {2026}
}