DrivingGPT:使用多模态自回归 Transformer 统一驱动世界建模与规划
计算机视觉与模式识别
2024-12-25 v1
摘要
基于世界模型的搜索与规划被广泛认为是通向人类水平物理智能的有前景之路。然而,当前的驾驶世界模型主要依赖视频扩散模型,这类模型专注于视觉生成,却缺乏融合其他模态(如动作)的灵活性。相比之下,自回归 Transformer 在建模多模态数据方面展现出卓越的能力。我们的工作旨在将驾驶模型仿真与轨迹规划统一为单一的序列建模问题。我们提出一种基于交错图像和动作标记的多模态驾驶语言,并开发 DrivingGPT 通过标准的下一个标记预测学习联合世界建模与规划。我们的 DrivingGPT 在动作条件视频生成和端到端规划方面均表现出强大的性能,在大规模 nuPlan 和 NAVSIM 基准测试中均优于强大的基线。
引用
@article{arxiv.2412.18607,
title = {DrivingGPT: Unifying Driving World Modeling and Planning with Multi-modal Autoregressive Transformers},
author = {Yuntao Chen and Yuqi Wang and Zhaoxiang Zhang},
journal= {arXiv preprint arXiv:2412.18607},
year = {2024}
}