基于 LLM 提示的上下文强化学习框架用于自动驾驶
机器人学
2025-05-23 v2 机器学习
摘要
将大语言模型 (LLM) 与强化学习 (RL) 集成可以增强自动驾驶 (AD) 在复杂场景中的性能。然而,当前的 LLM 主导型 RL 方法过度依赖 LLM 输出,这些输出容易产生幻觉。评估显示,最先进的 LLM 在关键驾驶相关任务上的非幻觉率仅约为 57.95%。因此,LLM 的幻觉可能直接危及驾驶策略的性能。本文认为,保持 LLM 与 RL 之间的相对独立性是解决幻觉问题的关键。因此,本文致力于提出一种新型 LLM 提示型 RL 范式。LLM 用于生成语义提示,用于状态增广和策略优化,以协助 RL 智能体进行运动规划,而 RL 智能体通过策略学习来抵消潜在的错误语义指示,从而实现出色的驾驶性能。基于此范式,我们提出了 HCRMP (LLM 提示型上下文强化学习运动规划器) 架构,其中包括增强语义表示模块以扩展状态空间。上下文稳定锚模块通过利用知识库中的信息来增强多 critic 权重提示的可靠性。语义缓存模块用于无缝集成 LLM 低频指导与 RL 高频控制。广泛的 CARLA 实验验证了 HCRMP 在各种驾驶条件下的强劲整体驾驶性能。HCRMP 在不同交通密度条件下实现了最高 80.3% 的任务成功率。在安全关键驾驶条件下,HCRMP 将碰撞率显著降低 11.4%,有效提升了复杂场景中的驾驶性能。
引用
@article{arxiv.2505.15793,
title = {HCRMP: A LLM-Hinted Contextual Reinforcement Learning Framework for Autonomous Driving},
author = {Zhiwen Chen and Bo Leng and Zhuoren Li and Hanming Deng and Guizhe Jin and Ran Yu and Huanxi Wen},
journal= {arXiv preprint arXiv:2505.15793},
year = {2025}
}