中文

最小最大 Stackelberg 博弈中的鲁棒无遗憾学习

计算机科学与博弈论 2022-04-15 v2 机器学习 理论经济学

摘要

无遗憾学习算法的性质在双人最小最大(即零和)博弈中已被充分理解。在本文中,我们研究具有依赖策略集的最小最大博弈中无遗憾学习的行为,其中第一名玩家的策略约束第二名玩家的行为。此类博弈最好被理解为序贯的,即最小最大 Stackelberg 博弈。我们考虑两种设定:其一仅第一名玩家使用无遗憾算法选择动作而第二名玩家最优响应,其二两名玩家均使用无遗憾算法。对于前者,我们证明无遗憾动态收敛到 Stackelberg 均衡。对于后者,我们引入一种新型遗憾,称之为拉格朗日遗憾(Lagrangian regret),并证明若两名玩家均最小化其拉格朗日遗憾,则博弈收敛到 Stackelberg 均衡。我们随后观察到,这两种设定下的在线镜像下降(OMD)动态分别对应于一种已知的嵌套(即序贯)梯度下降-上升(GDA)算法和一种新的同步类 GDA 算法,从而确立了这些算法到 Stackelberg 均衡的收敛性。最后,我们通过研究在线最小最大 Stackelberg 博弈来分析 OMD 动态对扰动的鲁棒性。我们证明 OMD 动态对于一大类具有独立策略集的在线最小最大博弈是鲁棒的。在依赖情形下,我们通过在在线 Fisher 市场中模拟 OMD 动态实验性地展示了其鲁棒性,而在线 Fisher 市场是具有依赖策略集的最小最大 Stackelberg 博弈的一个典型例子。

关键词

引用

@article{arxiv.2203.14126,
  title  = {Robust No-Regret Learning in Min-Max Stackelberg Games},
  author = {Denizalp Goktas and Jiayi Zhao and Amy Greenwald},
  journal= {arXiv preprint arXiv:2203.14126},
  year   = {2022}
}

备注

15 pages, 1 figure, 2 tables, 6 Algorithms; Forthcoming AAMAS'22. arXiv admin note: text overlap with arXiv:2110.05192