面向通用效用安全多智能体强化学习的可扩展原始-对偶 Actor-Critic 方法
机器学习
2023-05-30 v1 最优化与控制
摘要
我们研究安全多智能体强化学习,其中智能体寻求共同最大化局部目标的总和,同时满足自身的安全约束。目标和约束由通用效用描述,即长期状态-动作占据测度的非线性函数,其涵盖了更广泛的决策目标,如风险、探索或模仿。状态-动作空间大小随智能体数量呈指数增长,对全局可观测性提出挑战,并因智能体安全约束引起的全局耦合而进一步加剧。为解决此问题,我们提出一种原始-对偶方法,在一种相关衰减性质下利用影子奖励和 -跳邻居截断,其中 为通信半径。在精确设置下,我们的算法以 的速率收敛到一阶平稳点(FOSP)。在基于样本的设置下,我们证明以高概率,我们的算法需要 个样本来实现具有 近似误差的 -FOSP,其中 。最后,我们通过广泛的数值实验证明了我们模型的有效性。
引用
@article{arxiv.2305.17568,
title = {Scalable Primal-Dual Actor-Critic Method for Safe Multi-Agent RL with General Utilities},
author = {Donghao Ying and Yunkai Zhang and Yuhao Ding and Alec Koppel and Javad Lavaei},
journal= {arXiv preprint arXiv:2305.17568},
year = {2023}
}
备注
50 pages