DriveGPT4:基于大语言模型的可解释端到端自动驾驶
计算机视觉与模式识别
2024-11-12 v5 机器人学
摘要
多模态大语言模型(MLLM)因其在处理和理解图像、视频等非文本数据方面的能力,已成为研究界关注的重要领域。本研究旨在将 MLLM 的应用扩展至自动驾驶领域,提出 DriveGPT4,一种基于 LLM 的新型可解释端到端自动驾驶系统。DriveGPT4 能够处理多帧视频输入和文本查询,可解释车辆动作、提供相关推理,并有效回答用户提出的各类问题。此外,DriveGPT4 以端到端方式预测低级车辆控制信号。这些先进能力是通过使用专为自动驾驶应用定制的视觉指令微调数据集,结合混合微调训练策略实现的。DriveGPT4 是利用 LLM 开发可解释端到端自动驾驶方案的首次尝试。在 BDD-X 数据集上的评估展示了 DriveGPT4 卓越的定性与定量性能。此外,特定领域数据的微调使 DriveGPT4 在自动驾驶定位方面相较于 GPT4-V 取得接近甚至更好的结果。
引用
@article{arxiv.2310.01412,
title = {DriveGPT4: Interpretable End-to-end Autonomous Driving via Large Language Model},
author = {Zhenhua Xu and Yujia Zhang and Enze Xie and Zhen Zhao and Yong Guo and Kwan-Yee. K. Wong and Zhenguo Li and Hengshuang Zhao},
journal= {arXiv preprint arXiv:2310.01412},
year = {2024}
}
备注
Accepted by RA-L. The project page is available at https://tonyxuqaq.github.io/projects/DriveGPT4/