中文

面向端到端自动驾驶的 3D 视觉语言生成式规划

计算机视觉与模式识别 2025-01-16 v1

摘要

自动驾驶是一个需要感知和理解周围环境以实现安全轨迹规划的具有挑战性的任务。虽然已实现的基于视觉的端到端模型取得了令人鼓舞的成果,但这些方法仍面临视觉理解、决策推理和场景泛化等挑战。为解决这些问题,提出一种名为 GPVL 的 3D 视觉语言预训练生成式规划模型,用于端到端自动驾驶。该提出的范式具有两个显著方面。一方面,设计了 3D 视觉语言预训练模块,以在鸟瞰视图中桥接视觉感知与语言理解之间的差距。另一方面,引入交叉模态语言模型,以自动回归方式生成包含感知和导航信息的整体驾驶决策和细粒度轨迹。在具有挑战性的 nuScenes 数据集上进行的实验表明,所提出的方案比现有最先进的方法取得了优异的性能。此外,所提出的 GPVL 在处理各种场景中的高层命令时表现出强大的泛化能力和实时潜力。可以预见,GPVL 有效、稳健和高效的性能对于实现未来自动驾驶系统的实际应用至关重要。代码可在 https://github.com/ltp1995/GPVL 获取。

关键词

引用

@article{arxiv.2501.08861,
  title  = {Generative Planning with 3D-vision Language Pre-training for End-to-End Autonomous Driving},
  author = {Tengpeng Li and Hanli Wang and Xianfei Li and Wenlong Liao and Tao He and Pai Peng},
  journal= {arXiv preprint arXiv:2501.08861},
  year   = {2025}
}