多智能体约束策略优化
人工智能
2022-02-11 v2 多智能体系统
摘要
开发满足安全约束的强化学习算法在真实世界应用中正变得愈发重要。在多智能体强化学习(MARL)设定中,具备安全意识的策略优化尤其具有挑战性,因为每一个体智能体不仅须满足自身安全约束,还须考虑他者约束,方能保证其联合行为安全。尽管重要,安全多智能体学习问题尚未被严格研究;极少有方案被提出,亦缺乏可共享的测试环境或基准。为填补这些空白,本工作中我们将安全MARL问题形式化为约束马尔可夫博弈,并用策略优化方法求解。我们的解法——多智能体约束策略优化(MACPO)与MAPPO-Lagrangian——融合了来自约束策略优化与多智能体信任域学习的理论。关键的是,我们的方法在理论上保证每次迭代中奖励的单调提升与安全约束的满足。为检验方法有效性,我们开发了Safe Multi-Agent MuJoCo基准套件,涵盖多种MARL基线。实验结果证明MACPO/MAPPO-Lagrangian能持续满足安全约束,同时取得与强基线相当的性能。
引用
@article{arxiv.2110.02793,
title = {Multi-Agent Constrained Policy Optimisation},
author = {Shangding Gu and Jakub Grudzien Kuba and Munning Wen and Ruiqing Chen and Ziyan Wang and Zheng Tian and Jun Wang and Alois Knoll and Yaodong Yang},
journal= {arXiv preprint arXiv:2110.02793},
year = {2022}
}