安全多智能体强化学习:收敛于广义纳什均衡
机器学习
2024-11-25 v1 系统与控制
系统与控制
摘要
多智能体强化学习(MARL)在合作任务中取得显著成功,展现出惊人的性能和可扩展性。然而,在实际应用中部署 MARL 代理面临严峻的安全挑战。当前安全 MARL 算法主要基于受限马尔可夫决策过程(CMDP)框架,仅对折扣累积成本施加约束,缺乏全时段安全保障。此外,这些方法常忽视可行性问题(系统将在约束集的某些区域内违反状态约束),导致次优性能或增加约束违规。为此,本文提出一种新型安全 MARL 的理论框架,引入状态级约束,确保代理访问的每个状态都满足安全要求。为解决可行性问题,我们利用控制论中的可行域概念——受控不变集(CIS),其由安全价值函数特征化。我们开发了一种识别 CIS 的多智能体方法,确保其在安全价值函数上收敛至纳什均衡。通过将 CIS 识别集成到学习过程中,我们引入一种多智能体双策略迭代算法,保证在状态级约束下的合作马尔可夫游戏收敛至广义纳什均衡,在可行性与性能之间实现最佳平衡。此外,针对复杂高维系统的实际部署,我们提出“多智能体双演员-批评家”(MADAC),一种在深度强化学习范式下近似该迭代方案的安全 MARL 算法。实验结果表明,MADAC 在安全 MARL 基准测试中始终优于现有方法,在提高奖励的同时显著降低约束违规。
引用
@article{arxiv.2411.15036,
title = {Safe Multi-Agent Reinforcement Learning with Convergence to Generalized Nash Equilibrium},
author = {Zeyang Li and Navid Azizan},
journal= {arXiv preprint arXiv:2411.15036},
year = {2024}
}