约束多智能体强化学习中原对偶算法的解释
系统与控制
2023-04-28 v3 机器学习
多智能体系统
系统与控制
摘要
约束多智能体强化学习(C-MARL)正变得日益重要,因为 MARL 算法在从能源系统到无人机群的真实世界系统中找到了新应用。大多数 C-MARL 算法使用原对偶方法,通过添加到奖励中的惩罚函数来实施约束。在本文中,我们研究该惩罚项对 MARL 问题的结构性影响。首先,我们表明使用约束函数作为惩罚的标准做法会导致弱安全性概念。然而,通过对惩罚项进行简单修改,我们可以实施有意义的概率性(机会约束和条件风险价值)约束。其次,我们量化惩罚项对价值函数的影响,揭示了一种改进的价值估计过程。我们利用这些见解提出了一种约束多智能体优势 actor critic(C-MAA2C)算法。在一个简单约束多智能体环境中的仿真证实了我们将原对偶方法重新解释为概率约束是有效的,并且我们提出的价值估计加速了向安全联合策略的收敛。
引用
@article{arxiv.2211.16069,
title = {Interpreting Primal-Dual Algorithms for Constrained Multiagent Reinforcement Learning},
author = {Daniel Tabas and Ahmed S. Zamzam and Baosen Zhang},
journal= {arXiv preprint arXiv:2211.16069},
year = {2023}
}
备注
19 pages, 8 figures. Presented at L4DC 2023