具进化能力的自动驾驶:基于单调性能提升的强化学习方法
系统与控制
2024-12-17 v1 系统与控制
摘要
强化学习(RL)为实现可进化的自动驾驶提供了有前景的解决方案。然而,传统 RL 方法始终关注风险性能,更新的策略可能无法获得性能提升,甚至导致性能恶化。为解决此挑战,本研究提出了基于高置信区间策略改进的强化学习(HCPI-RL)规划器。旨在实现自动驾驶的单调性能演化。设计了一种新的 RL 策略更新范式,使新学习的策略性能始终超过以前的策略,称为单调性能提升。因此,所提出的 HCPI-RL 规划器具有以下特征:i)具单调性能提升能力的可进化自动驾驶;ii)具备处理紧急情境的能力;iii)具备增强决策最优性。结果表明,与 PPO 规划器相比,HCPI-RL 规划器在紧急切入情境中提升策略回报 44.7%,在紧急制动情境中提升 108.2%,在日常巡航情境中提升 64.4%。采用该规划器后,自动驾驶效率相对于 PPO 规划器提升 19.2%,相对于基于规则的规划器提升 30.7%。
引用
@article{arxiv.2412.10822,
title = {Automated Driving with Evolution Capability: A Reinforcement Learning Method with Monotonic Performance Enhancement},
author = {Jia Hu and Xuerun Yan and Tian Xu and Haoran Wang},
journal= {arXiv preprint arXiv:2412.10822},
year = {2024}
}
备注
24 pages, 16figures