中文

基于双层优化的自主驾驶安全多智能体强化学习

机器人学 2024-05-29 v1 机器学习

摘要

确保在MARL中实现安全,特别是在部署到实际应用场景时,例如自主驾驶,成为一个关键挑战。为此,传统的安全MARL方法将MARL方法扩展以包含安全考虑,旨在最小化安全风险值。然而,这些安全MARL算法往往无法建模其他智能体,且在动态复杂环境中缺乏收敛性保证。本文提出一种基于Stackelberg模型的安全MARL方法,其中包含双层优化,提供了收敛分析。基于我们的理论分析,我们开发了两种实用算法,即受限Stackelberg Q学习(CSQ)和受限Stackelberg多智能体深度确定性策略梯度(CS-MADDPG),旨在促进自主驾驶应用中的MARL决策。为评估所提算法的有效性,我们开发了一个安全MARL自主驾驶基准,并在具有挑战性的自主驾驶场景中进行了实验,包括汇入、环形交叉口、交叉口和赛道。实验结果表明,所提出的算法CSQ和CS-MADDPG在奖励和安全性能方面均优于多个强大的MARL基线,如Bi-AC、MACPO和MAPPO-L。演示和源代码可在 {https://github.com/SafeRL-Lab/Safe-MARL-in-Autonomous-Driving.git} 获取。

关键词

引用

@article{arxiv.2405.18209,
  title  = {Safe Multi-Agent Reinforcement Learning with Bilevel Optimization in Autonomous Driving},
  author = {Zhi Zheng and Shangding Gu},
  journal= {arXiv preprint arXiv:2405.18209},
  year   = {2024}
}