中文

网络随机零和博弈中的无遗憾学习

最优化与控制 2022-05-31 v1 计算机科学与博弈论

摘要

无遗憾学习已广泛用于计算二人零和博弈中的纳什均衡。然而,对于网络随机零和博弈,仍缺乏遗憾分析,其中在两个子网络中竞争的参与者仅能获取某些局部信息,且代价函数包含不确定性。这种博弈模型可见于安全博弈中,当一组检查员协同工作以检测一组逃避者时。在本文中,我们提出一种分布式随机镜像下降(D-SMD)方法,并在期望意义下针对凸-凹和强凸-强凹代价分别建立了 O(T)O(\sqrt{T})O(logT)O(\log T) 的遗憾界。我们的界与已知最佳一阶在线优化算法相匹配。然后,我们证明了 D-SMD 的时间平均迭代点收敛到纳什均衡集合。最后,我们展示了在严格凸-严格凹设定下 D-SMD 的实际迭代点几乎必然收敛到纳什均衡。

关键词

引用

@article{arxiv.2205.14662,
  title  = {No-Regret Learning in Network Stochastic Zero-Sum Games},
  author = {Shijie Huang and Jinlong Lei and Yiguang Hong},
  journal= {arXiv preprint arXiv:2205.14662},
  year   = {2022}
}