中文

ProphetDWM:一种用于滚动未来动作和视频的驾驶世界模型

计算机视觉与模式识别 2025-05-27 v1

摘要

现实世界的驾驶需要人们观察当前环境、预见未来并作出恰当的驾驶决策。这一要求与世界模型的能力相吻合——它们理解环境并预测未来。然而,最近的自主驾驶世界模型都是显式构建的,能够通过可控驾驶视频生成来预测未来。我们认为,驾驶世界模型应具备两个额外能力:动作控制和动作预测。紧随其后的方法受限于预测视频需要给定与视频长度相同的动作序列,同时忽略了动作的动态规律。为此,我们提出ProphetDWM,这是一种新的端到端驾驶世界模型,联合预测未来视频和动作。我们的世界模型包含一个动作模块,通过给定动作序列和观测来学习从当前到未来时段的潜在动作。以及一个基于扩散模型的转换模块来学习状态分布。该模型通过学习给定有限状态的潜在动作以及预测动作和视频进行联合训练。联合学习将动作动力学与状态连接起来,使能够进行长期未来预测。我们在Nuscenes数据集上对视频生成和动作预测任务进行评估。与当前方法相比,我们的方法在视频一致性和动作预测准确率方面取得最佳成绩,同时实现了高质量的长期视频和动作生成。

关键词

引用

@article{arxiv.2505.18650,
  title  = {ProphetDWM: A Driving World Model for Rolling Out Future Actions and Videos},
  author = {Xiaodong Wang and Peixi Peng},
  journal= {arXiv preprint arXiv:2505.18650},
  year   = {2025}
}

备注

9 pages, 7 figures