中文

零和博弈中面向末轮收敛的变异驱动跟随正则化领导者算法

计算机科学与博弈论 2022-06-22 v1 机器学习 机器学习

摘要

本研究考虑二人零和博弈中跟随正则化领导者(FTRL)动态的一个变体。FTRL 在对策略进行时间平均时保证收敛到纳什均衡,但许多变体存在极限循环行为问题,即缺乏末轮收敛保证。为此,我们提出变异 FTRL(M-FTRL),该算法引入变异以扰动动作概率。我们随后研究了 M-FTRL 的连续时间动态,并提供了在全信息反馈下逼近纳什均衡的驻点强收敛保证。此外,我们的仿真表明,在全信息反馈下,M-FTRL 可比 FTRL 和乐观 FTRL 享有更快的收敛速度,并在赌博机反馈下令人惊讶地展现出清晰的收敛性。

关键词

引用

@article{arxiv.2206.09254,
  title  = {Mutation-Driven Follow the Regularized Leader for Last-Iterate Convergence in Zero-Sum Games},
  author = {Kenshi Abe and Mitsuki Sakamoto and Atsushi Iwasaki},
  journal= {arXiv preprint arXiv:2206.09254},
  year   = {2022}
}

备注

Accepted in UAI 2022