中文

具有扰动收益与未知转移的随机博弈中的平滑虚拟博弈

计算机科学与博弈论 2022-07-08 v1

摘要

近期对静态博弈中著名虚拟博弈学习过程的动态博弈扩展,被证明在两类重要动态博弈(零和及同利益折扣随机博弈)中全局收敛到平稳纳什均衡。然而,那些分散式算法需要参与者精确知道模型(每阶段的转移概率及其收益)。为克服这些强假设,我们的论文对 (Leslie 2020; Baudin 2022) 中的系统引入正则化,以构造一系列新的分散式学习算法,这些算法是无模型的(参与者不知道转移且每阶段其收益被扰动)。我们的过程可视为静态博弈中经典平滑虚拟博弈学习过程(参与者的最佳响应被正则化,得益于其收益函数的平滑严格凹扰动)向随机博弈的扩展。我们证明了我们的过程族在零和及同利益折扣随机博弈中收敛到平稳正则化纳什均衡。证明使用了连续平滑最佳响应动力学对应和随机近似方法。当只有一个参与者时,我们的问题是强化学习的一个实例,且我们的过程被证明全局收敛到正则化 MDP 的最优平稳策略。就此意义而言,它们可视为著名 Q-learning 过程的替代。

关键词

引用

@article{arxiv.2207.03109,
  title  = {Smooth Fictitious Play in Stochastic Games with Perturbed Payoffs and Unknown Transitions},
  author = {Lucas Baudin and Rida Laraki},
  journal= {arXiv preprint arXiv:2207.03109},
  year   = {2022}
}