中文

测试大型语言模型在连接式自动驾驶车辆的驾驶理论知识与技能

人工智能 2024-07-25 v1 网络与互联网体系结构 机器人学

摘要

处理长尾角落情况是自动驾驶车辆(AVs)面临的主要挑战。尽管大型语言模型(LLMs)因其出色的泛化和解释能力而在自动驾驶领域受到日益关注,但仍存在技术障碍,如严格的模型性能要求和巨大的计算资源需求。本文研究了一种将远程或边缘 LLMs 应用于自动驾驶的新方法。对于此类 LLM 辅助驾驶系统而言,关键问题在于评估 LLMs 对驾驶理论和技能的理解能力,确保其具备为 CAVs 执行安全关键驾驶辅助任务的资格。我们设计并运行了针对几种专有 LLM 模型(OpenAI GPT 模型、百度 Ernie 和阿里 QWen)以及开源 LLM 模型(清华 MiniCPM-2B 和 MiniCPM-Llama3-V2.5)的驾驶理论测试,包含超过 500 个多选理论测试问题。从实验中测量了模型准确率、成本和处理延迟。实验结果表明,GPT-4 在改进的领域知识下通过了测试,Ernie 的准确率为85%(仅略低于86%的通过阈值),而其他 LLM 模型包括 GPT-3.5 均未通过测试。对于包含图片的测试问题,多模态模型 GPT4-o 取得了96%的优异准确率,MiniCPM-Llama3-V2.5 的准确率为76%。尽管 GPT-4 在 CAV 驾驶辅助应用方面具有更大的潜力,但使用 GPT4 模型的成本约为 GPT3.5 的50倍。这些结果有助于在 CAV 应用中决定使用现有 LLMs,并在模型性能和成本之间进行权衡。

关键词

引用

@article{arxiv.2407.17211,
  title  = {Testing Large Language Models on Driving Theory Knowledge and Skills for Connected Autonomous Vehicles},
  author = {Zuoyin Tang and Jianhua He and Dashuai Pei and Kezhong Liu and Tao Gao},
  journal= {arXiv preprint arXiv:2407.17211},
  year   = {2024}
}