中文

具有全知跟随者的Stackelberg博弈中的在线学习

机器学习 2023-04-13 v2

摘要

我们研究双人去中心化合作型Stackelberg博弈中的在线学习问题。在每一轮中,领导者首先采取行动,随后跟随者在观察到领导者的行动后采取自己的行动。领导者的目标是基于交互历史学习以最小化累积后悔。与重复Stackelberg博弈的传统形式不同,我们假设跟随者是全知的,完全知晓真实奖励,并且总是对领导者的行动做出最优响应。我们分析了该重复Stackelberg博弈中后悔最小化的样本复杂度。我们表明,根据奖励结构的不同,全知跟随者的存在可能使样本复杂度发生剧烈变化,从常数级到指数级,即便对于线性合作型Stackelberg博弈也是如此。这给领导者的学习过程及随后的后悔分析带来了独特挑战。

关键词

引用

@article{arxiv.2301.11518,
  title  = {Online Learning in Stackelberg Games with an Omniscient Follower},
  author = {Geng Zhao and Banghua Zhu and Jiantao Jiao and Michael I. Jordan},
  journal= {arXiv preprint arXiv:2301.11518},
  year   = {2023}
}