多智能体零和博弈一种推广中的 $O(1/T)$ 时间平均收敛性
计算机科学与博弈论
2021-10-07 v1 多智能体系统
摘要
我们引入零和 networked 多智能体矩阵博弈的一种推广,并证明对于该类博弈,交替梯度下降以 的速率收敛到纳什均衡集。交替梯度下降在使用比乐观梯度下降变体大四倍的固定学习率的同时,获得了该收敛保证。在实验中,我们以 97.5% 的置信度表明,平均而言,这些更大的学习率导致时间平均策略比乐观梯度下降更接近纳什均衡集 2.585 倍。
引用
@article{arxiv.2110.02482,
title = {$O\left(1/T\right)$ Time-Average Convergence in a Generalization of Multiagent Zero-Sum Games},
author = {James P. Bailey},
journal= {arXiv preprint arXiv:2110.02482},
year = {2021}
}