中文

SimpleLLM4AD: 一种用于自动驾驶的端到端视觉语言模型与图视觉问答

计算机视觉与模式识别 2024-08-01 v1 人工智能

摘要

许多领域可以从大型语言模型(LLM)的快速发展中受益。端到端自动驾驶(e2eAD)是其中一个典型领域,随着LLM支持越来越多的模态,该领域面临着新的机遇。在这里,我们利用视觉语言模型(VLM),提出了一种名为SimpleLLM4AD的e2eAD方法。在我们的方法中,e2eAD任务被划分为四个阶段:感知、预测、规划和行为。每个阶段由若干视觉问答(VQA)对组成,且VQA对之间相互连接,构成一个称为图视觉问答(GVQA)的图。通过VLM阶段性地推理GVQA中的每个VQA对,我们的方法可以实现基于语言的端到端驾驶。在我们的方法中,视觉Transformer(ViT)模型被用于处理nuScenes视觉数据,而VLM被用于解释和推理从视觉输入中提取的信息。在感知阶段,系统从驾驶环境中识别和分类物体。预测阶段涉及预测这些物体的潜在运动。规划阶段利用收集到的信息制定驾驶策略,确保自动驾驶车辆的安全性和效率。最后,行为阶段将规划的动作转化为车辆的可执行命令。我们的实验表明SimpleLLM4AD在复杂驾驶场景中展现出具有竞争力的性能。

关键词

引用

@article{arxiv.2407.21293,
  title  = {SimpleLLM4AD: An End-to-End Vision-Language Model with Graph Visual Question Answering for Autonomous Driving},
  author = {Peiru Zheng and Yun Zhao and Zhan Gong and Hong Zhu and Shaohua Wu},
  journal= {arXiv preprint arXiv:2407.21293},
  year   = {2024}
}

备注

16 pages, 3 figures