中文

GPD-1:驾驶的生成式预训练

计算机视觉与模式识别 2024-12-12 v1 人工智能 机器学习 机器人学

摘要

建模驾驶情景的演化对于评估和决策至关重要。现有大多数方法仅聚焦于场景演化的一个方面,如地图生成、运动预测和轨迹规划。本文提出一种统一的驾驶生成式预训练模型 (GPD-1),该模型能够无需额外微调地完成上述所有任务。我们将每个场景表示为 ego、agent 和 map tokens,并将自动驾驶建模为统一的 token 生成问题。我们采用自回归 transformer 架构并使用场景级注意力掩码以实现 scene-level 双向交互。对于 ego 和 agent tokens,我们提出了分层位置标记化器,以有效编码 2D 位置和朝向。对于 map tokens,我们训练一个地图向量量化自编码器,以高效压缩 ego-centric 语义地图至离散 tokens。我们在大规模 nuPlan 数据集上对 GPD-1 进行预训练,并进行大量实验以评估其有效性。通过不同提示,GPD-1 成功地在无需微调的情况下泛化到各种任务,包括场景生成、交通仿真、闭环仿真、地图预测和运动规划。代码:https://github.com/wzzheng/GPD。

关键词

引用

@article{arxiv.2412.08643,
  title  = {GPD-1: Generative Pre-training for Driving},
  author = {Zixun Xie and Sicheng Zuo and Wenzhao Zheng and Yunpeng Zhang and Dalong Du and Jie Zhou and Jiwen Lu and Shanghang Zhang},
  journal= {arXiv preprint arXiv:2412.08643},
  year   = {2024}
}

备注

Code is available at: https://github.com/wzzheng/GPD