中文

基于调和梯度的分布式软演员-批判 with 安全高效的自动驾驶

机器人学 2025-05-21 v1 人工智能 机器学习

摘要

强化学习(Reinforcement Learning, RL)以其自我演化能力,为训练高级自动驾驶系统提供了有前景的途径。然而,在实际应用中处理约束仍是现有 RL 算法的重大挑战。本文我们提出了一种新的以安全为导向的训练技术,称为调和策略迭代(harmonic policy iteration, HPI)。在每个 RL 迭代中,它首先计算与高效驾驶和安全约束相关的两个策略梯度。然后,推导出调和梯度用于策略更新,最小化两个梯度之间的冲突,从而实现更平衡和稳定的训练过程。此外,我们采用最新的 DSAC 算法作为骨架并将其与我们的 HPI 集成,开发出一种新的安全 RL 算法 DSAC-H。 Extensive 模拟实验在多车道场景中表明,DSAC-H 在实现高效驾驶性能的同时实现了接近零的安全约束违规。

关键词

引用

@article{arxiv.2505.13532,
  title  = {Distributional Soft Actor-Critic with Harmonic Gradient for Safe and Efficient Autonomous Driving in Multi-lane Scenarios},
  author = {Feihong Zhang and Guojian Zhan and Bin Shuai and Tianyi Zhang and Jingliang Duan and Shengbo Eben Li},
  journal= {arXiv preprint arXiv:2505.13532},
  year   = {2025}
}

备注

IEEE Intelligent Vehicles Symposium (IV 2025)