中文

一般和随机博弈纳什均衡学习的分散式策略梯度方法

系统与控制 2022-10-19 v2 人工智能 计算机科学与博弈论 多智能体系统 系统与控制

摘要

我们研究具有未知转移概率密度函数的一般和随机博弈的纳什均衡学习。智能体在当前环境状态下采取动作,其联合动作影响环境状态的转移与各自的即时奖励。每个智能体仅观测环境状态与自身即时奖励,且不知晓其他智能体的动作或即时奖励。我们引入以概率 1 和依概率的加权渐近纳什均衡概念。对于具有精确伪梯度的情况,我们利用纳什均衡与变分不等式问题的等价性设计了一种双循环算法。在外循环中,我们通过更新近端正则参数依次更新所构造的强单调变分不等式,同时在内循环中使用单调用额外梯度算法求解所构造的变分不等式。我们证明,若相关的 Minty 变分不等式有解,则所设计算法收敛到 k^{1/2}-加权渐近纳什均衡。进一步,对于伪梯度未知的情况,我们提出一种分散式算法,其中伪梯度的 G(PO)MDP 梯度估计器由蒙特卡洛模拟给出。该算法实现了依概率收敛到 k^{1/4}-加权渐近纳什均衡。

关键词

引用

@article{arxiv.2210.07651,
  title  = {Decentralized Policy Gradient for Nash Equilibria Learning of General-sum Stochastic Games},
  author = {Yan Chen and Tao Li},
  journal= {arXiv preprint arXiv:2210.07651},
  year   = {2022}
}