中文

基于去中心化影子奖励 Actor-Critic 的通用效用多智能体强化学习

机器学习 2021-06-25 v2 人工智能 机器学习 最优化与控制

摘要

我们基于团队长期状态-动作占据测度的任意非线性函数(即\emph{通用效用})提出一种新的多智能体强化学习(MARL)合作机制。这涵盖了累积回报,也允许纳入风险敏感性、探索与先验。我们推导了\emph{去中心化影子奖励 Actor-Critic(DSAC)},其中智能体交替进行策略评估(评论家)、与邻居的加权平均(信息混合)以及对其策略参数的局部梯度更新(行动者)。DSAC 在经典评论家步骤上要求智能体 (i) 估计其局部占据测度,以 (ii) 估计局部效用相对于其占据测度的导数,即“影子奖励”。DSAC 以高概率在 O(1/ϵ2.5)\mathcal{O}(1/\epsilon^{2.5})(定理 \ref{theorem:final})或更少步数 O(1/ϵ2)\mathcal{O}(1/\epsilon^{2})(推论 \ref{corollary:communication})内收敛至 ϵ\epsilon-平稳点,具体取决于通信量。我们进一步确立了该问题不存在伪平稳点,即 DSAC 能找到全局最优策略(推论 \ref{corollary:global})。实验展示了在合作 MARL 中超越累积回报的目标的优势。

关键词

引用

@article{arxiv.2106.00543,
  title  = {MARL with General Utilities via Decentralized Shadow Reward Actor-Critic},
  author = {Junyu Zhang and Amrit Singh Bedi and Mengdi Wang and Alec Koppel},
  journal= {arXiv preprint arXiv:2106.00543},
  year   = {2021}
}