中文

PKRD-CoT:面向自动驾驶中多模态大语言模型的统一链律提示设计

机器人学 2024-12-04 v1 人工智能

摘要

越来越多的人关注的是直接在自动驾驶上下文中利用强大多模态大语言模型(MLLMs)的能力。然而,设计和训练端到端自动驾驶模型的高成本和复杂性,使得它们对许多企业和研究实体构成挑战。为此,我们的研究探索了将MLLMs无缝集成到自动驾驶系统中的方法,提出一种名为PKRD-CoT的零样本链律提示设计。PKRD-CoT基于自动驾驶的四个基本能力:感知、知识、推理和决策。这使其特别适合理解和响应动态驾驶环境,通过逐步模拟人类思维过程来增强现实场景中的决策。我们的设计使MLLMs能够在没有先前经验的情况下解决问题,从而增加了其在非结构化自动驾驶环境中的实用性。在实验中,我们展示了GPT-4.0在PKRD-CoT下的卓越性能,突显了在自动驾驶场景中的有效性。此外,我们的基准分析揭示了PKRD-CoT对其他MLLMs(如Claude、LLava1.6和Qwen-VL-Plus)的前景。总体而言,本研究为GPT-4.0及其他MLLMs在自动驾驶领域提供了一种新颖且统一的提示设计框架,同时通过全面比较严格评估了这些广为人知的MLLMs在自动驾驶领域的有效性。

关键词

引用

@article{arxiv.2412.02025,
  title  = {PKRD-CoT: A Unified Chain-of-thought Prompting for Multi-Modal Large Language Models in Autonomous Driving},
  author = {Xuewen Luo and Fan Ding and Yinsheng Song and Xiaofeng Zhang and Junnyong Loo},
  journal= {arXiv preprint arXiv:2412.02025},
  year   = {2024}
}

备注

This paper has been accepted for presentation at ICONIP 2024