零和博弈中面向末轮收敛的变异驱动跟随正则化领导者算法
计算机科学与博弈论
2022-06-22 v1 机器学习
机器学习
摘要
本研究考虑二人零和博弈中跟随正则化领导者(FTRL)动态的一个变体。FTRL 在对策略进行时间平均时保证收敛到纳什均衡,但许多变体存在极限循环行为问题,即缺乏末轮收敛保证。为此,我们提出变异 FTRL(M-FTRL),该算法引入变异以扰动动作概率。我们随后研究了 M-FTRL 的连续时间动态,并提供了在全信息反馈下逼近纳什均衡的驻点强收敛保证。此外,我们的仿真表明,在全信息反馈下,M-FTRL 可比 FTRL 和乐观 FTRL 享有更快的收敛速度,并在赌博机反馈下令人惊讶地展现出清晰的收敛性。
引用
@article{arxiv.2206.09254,
title = {Mutation-Driven Follow the Regularized Leader for Last-Iterate Convergence in Zero-Sum Games},
author = {Kenshi Abe and Mitsuki Sakamoto and Atsushi Iwasaki},
journal= {arXiv preprint arXiv:2206.09254},
year = {2022}
}
备注
Accepted in UAI 2022