子网络零和博弈中的无遗憾分布式学习
最优化与控制
2021-08-05 v1
摘要
本文考虑子网络零和博弈中的分布式学习问题,其中智能体在不同的子网络中相互竞争。这些智能体通过时变图相连,每个智能体拥有自己的代价函数并能够从其邻居处接收信息。我们提出一种分布式镜像下降算法来计算纳什均衡,并在图一致强连通且代价函数为凸-凹时,建立了迭代序列上的次线性遗憾界。此外,对于严格凸-凹代价函数,我们证明了在适当选取递减步长下的收敛性。我们还考虑了该算法的常数步长变体,并建立了运行平均动作与纳什均衡之间代价函数值的渐近误差界。另外,我们将该算法应用于计算子网络零和有限策略博弈中的混合策略纳什均衡,此类博弈仅具有凸-凹(具体而言为双线性)代价函数,并在不同假设下分别获得了末次迭代收敛结果与遍历收敛结果。
引用
@article{arxiv.2108.02144,
title = {No-regret distributed learning in subnetwork zero-sum games},
author = {Shijie Huang and Jinlong Lei and Yiguang Hong and Uday V. Shanbhag and Jie Chen},
journal= {arXiv preprint arXiv:2108.02144},
year = {2021}
}