面向网联自动驾驶车辆的安全保证鲁棒多智能体分层控制强化学习
机器人学
2024-09-25 v2 多智能体系统
摘要
我们解决了在混合交通环境中存在不完美观测时网联自动驾驶车辆(CAVs)的协调与控制问题。一种常用方法是基于学习的决策,例如强化学习(RL)。然而,大多数现有安全 RL 方法存在两个局限:(i) 它们假设状态信息准确;(ii) 安全性通常定义在轨迹的期望之上。在设计多智能体间的最优协调的同时,在系统状态不确定性(例如由噪声传感器测量、通信或状态估计方法引起的不确定性)下于每个时间步确保硬安全约束,仍然具有挑战性。我们提出一种称为 Safe-RMM 的安全保证分层协调与控制方案以应对该挑战。具体而言,混合交通环境中 CAVs 的高层协调策略由鲁棒多智能体近端策略优化(RMAPPO)方法训练。尽管训练时不含不确定性,我们的方法利用最坏情况 Q 网络以确保模型在测试时存在状态不确定性下的鲁棒性能。低层控制器使用带有鲁棒控制障碍函数(CBFs)的模型预测控制(MPC)实现,通过其前向不变性性质保证安全性。我们在 CARLA 仿真器中不同道路网络下将我们的方法与基线比较。结果表明,在具有不确定性的挑战性混合交通环境中,我们的方法提供了最佳评估安全性与效率。
引用
@article{arxiv.2309.11057,
title = {Safety Guaranteed Robust Multi-Agent Reinforcement Learning with Hierarchical Control for Connected and Automated Vehicles},
author = {Zhili Zhang and H M Sabbir Ahmad and Ehsan Sabouni and Yanchao Sun and Furong Huang and Wenchao Li and Fei Miao},
journal= {arXiv preprint arXiv:2309.11057},
year = {2024}
}
备注
6 pages, 6 figures