利用多模态提示令牌增强基于大语言模型的端到端自动驾驶模仿学习
机器人学
2024-07-30 v2 人工智能
摘要
大语言模型(LLMs)在强化学习领域,特别是作为规划器,近年来在学术文献中引起了广泛关注。然而,现有研究很大一部分主要关注机器人的规划模型,这些模型将感知模型的输出转化为语言形式,从而采用“纯语言”策略。在本研究中,我们提出了一种用于自动驾驶的混合端到端学习框架,将基本的驾驶模仿学习与基于多模态提示令牌的LLMs相结合。我们的新颖之处在于两个方面,而不是简单地将分离训练模型的感知结果转换为纯语言输入:1)将视觉和LiDAR传感器输入端到端集成到可学习的多模态令牌中,从而从根本上减轻由分离预训练感知模型引起的描述偏差。2)本文不是直接让LLMs驾驶,而是探索一种混合设置,让LLMs帮助驾驶模型纠正错误和处理复杂场景。我们的实验结果表明,所提出的方法在通过CARLA进行的离线评估中可以获得49.21%的驾驶分数,以及令人印象深刻的91.34%的路线完成率。这些性能指标与最先进的驾驶模型相当。
引用
@article{arxiv.2404.04869,
title = {Prompting Multi-Modal Tokens to Enhance End-to-End Autonomous Driving Imitation Learning with LLMs},
author = {Yiqun Duan and Qiang Zhang and Renjing Xu},
journal= {arXiv preprint arXiv:2404.04869},
year = {2024}
}