中文

面向自动高速公路驾驶的语言动作引导强化学习(LA-RL):安全保障

系统与控制 2025-12-08 v1 系统与控制

摘要

自动高速公路驾驶需要在主动、效率导向的行为与强大安全保障之间取得关键平衡。本文提出了语言动作引导强化学习(LA-RL)与安全保障的新框架,将大型语言模型(LLM)的语义推理集成到演员-批评家架构中,并改进了安全层。在该框架中,任务特定的奖励塑造协调实现数据效率最大化和安全保证的双重目标,基于环境洞察和明确定义的目标指导决策。为增强安全性,LA-RL集成了一种安全关键规划器,将模型预测控制(MPC)与离散控制屏障函数(DCBFs)结合。该层形式化地将LLM-informed策略限制在安全动作集合中,采用松弛机制增强解的可行性,防止过于保守的行为,允许在不牺牲安全性的前提下获得更大的策略探索。广泛实验表明,它显著优于几种当前主流方法,为自动高速公路驾驶提供了更具适应性、可靠和稳健的解决方案。与现有SOTA相比,它比基于知识图谱(KG)的基线成功率高约20%,比基于检索增强生成(RAG)的基线高约30%。在低密度环境中,LA-RL实现100%的成功率。这些结果确认了其对状态-动作空间的更好探索,以及其在复杂混合交通高速公路环境中自主采用更高效、更主动策略的能力。

关键词

引用

@article{arxiv.2512.05686,
  title  = {LA-RL: Language Action-guided Reinforcement Learning with Safety Guarantees for Autonomous Highway Driving},
  author = {Yiming Shu and Jiahui Xu and Jiwei Tang and Ruiyang Gao and Chen Sun},
  journal= {arXiv preprint arXiv:2512.05686},
  year   = {2025}
}