中文

面向通用效用安全多智能体强化学习的可扩展原始-对偶 Actor-Critic 方法

机器学习 2023-05-30 v1 最优化与控制

摘要

我们研究安全多智能体强化学习,其中智能体寻求共同最大化局部目标的总和,同时满足自身的安全约束。目标和约束由通用效用描述,即长期状态-动作占据测度的非线性函数,其涵盖了更广泛的决策目标,如风险、探索或模仿。状态-动作空间大小随智能体数量呈指数增长,对全局可观测性提出挑战,并因智能体安全约束引起的全局耦合而进一步加剧。为解决此问题,我们提出一种原始-对偶方法,在一种相关衰减性质下利用影子奖励和 κ\kappa-跳邻居截断,其中 κ\kappa 为通信半径。在精确设置下,我们的算法以 O(T2/3)\mathcal{O}\left(T^{-2/3}\right) 的速率收敛到一阶平稳点(FOSP)。在基于样本的设置下,我们证明以高概率,我们的算法需要 O~(ϵ3.5)\widetilde{\mathcal{O}}\left(\epsilon^{-3.5}\right) 个样本来实现具有 O(ϕ02κ)\mathcal{O}(\phi_0^{2\kappa}) 近似误差的 ϵ\epsilon-FOSP,其中 ϕ0(0,1)\phi_0\in (0,1)。最后,我们通过广泛的数值实验证明了我们模型的有效性。

关键词

引用

@article{arxiv.2305.17568,
  title  = {Scalable Primal-Dual Actor-Critic Method for Safe Multi-Agent RL with General Utilities},
  author = {Donghao Ying and Yunkai Zhang and Yuhao Ding and Alec Koppel and Javad Lavaei},
  journal= {arXiv preprint arXiv:2305.17568},
  year   = {2023}
}

备注

50 pages