中文

基于控制屏障函数的安全层次化多智能体强化学习

机器学习 2025-08-19 v2 人工智能 机器人学

摘要

我们解决了在多智能体安全关键自主系统中的安全策略学习问题。在此类系统中,每个智能体都必须在始终满足安全要求的同时,与其他智能体合作完成任务。为此,我们提出了一种基于控制屏障函数(CBF)的安全层次化多智能体强化学习(HMARL)方法。我们的层次化方法将整体强化学习问题分解为两个层次:在高层学习联合合作行为,在低层或智能体层条件化高层策略的学习安全个体行为。具体而言,我们提出了一种基于技能的HMARL-CBF算法,其中高层问题涉及学习所有智能体技能的联合策略,低层问题涉及学习安全执行技能的策略。我们在具有挑战性环境情景上的验证——在这些情景中,大量智能体必须通过相互冲突的道路网络进行安全导航。与现有最先进方法相比,我们的方法在安全性方面显著提升,实现了接近完美(在5%以内)的成功/安全率,同时在所有环境中提升了性能。

关键词

引用

@article{arxiv.2507.14850,
  title  = {Hierarchical Multi-Agent Reinforcement Learning with Control Barrier Functions for Safety-Critical Autonomous Systems},
  author = {H. M. Sabbir Ahmad and Ehsan Sabouni and Alexander Wasilkoff and Param Budhraja and Zijian Guo and Songyuan Zhang and Chuchu Fan and Christos Cassandras and Wenchao Li},
  journal= {arXiv preprint arXiv:2507.14850},
  year   = {2025}
}