中文

Stackelberg博弈中学习动态的收敛性

计算机科学与博弈论 2024-12-07 v3 机器学习 系统与控制 系统与控制

摘要

本文研究Stackelberg博弈中学习动态的收敛性。在我们考虑的游戏类中,领导者与跟随者之间以连续动作空间进行层次化博弈。我们建立了Nash均衡与Stackelberg均衡概念之间的若干联系,并刻画了在零和博弈中同时梯度下降的吸引临界点成为Stackelberg均衡的条件。此外,我们证明Stackelberg梯度动态的唯一稳定临界点是零和博弈中的Stackelberg均衡。利用这一见解,我们为领导者开发了基于梯度的更新,而跟随者采用最佳响应策略,使得每个稳定临界点保证是零和博弈中的Stackelberg均衡。因此,给定在稳定临界点吸引域内的初始化,学习规则可证明收敛到Stackelberg均衡。然后我们考虑跟随者采用梯度博弈更新规则而非最佳响应策略,并提出了具有类似渐近收敛保证的双时间尺度算法。对于该算法,我们还给出了在一般和博弈中局部收敛到稳定Stackelberg均衡邻域的有限时间高概率界。最后,我们给出了广泛的数值结果,验证了我们的理论,提供了对生成对抗网络优化景观的见解,并证明了我们提出的学习动态能有效训练生成对抗网络。

关键词

引用

@article{arxiv.1906.01217,
  title  = {Convergence of Learning Dynamics in Stackelberg Games},
  author = {Tanner Fiez and Benjamin Chasnov and Lillian J. Ratliff},
  journal= {arXiv preprint arXiv:1906.01217},
  year   = {2024}
}

备注

This version includes numerical results training generative adversarial networks