具有全知跟随者的Stackelberg博弈中的在线学习
机器学习
2023-04-13 v2
摘要
我们研究双人去中心化合作型Stackelberg博弈中的在线学习问题。在每一轮中,领导者首先采取行动,随后跟随者在观察到领导者的行动后采取自己的行动。领导者的目标是基于交互历史学习以最小化累积后悔。与重复Stackelberg博弈的传统形式不同,我们假设跟随者是全知的,完全知晓真实奖励,并且总是对领导者的行动做出最优响应。我们分析了该重复Stackelberg博弈中后悔最小化的样本复杂度。我们表明,根据奖励结构的不同,全知跟随者的存在可能使样本复杂度发生剧烈变化,从常数级到指数级,即便对于线性合作型Stackelberg博弈也是如此。这给领导者的学习过程及随后的后悔分析带来了独特挑战。
引用
@article{arxiv.2301.11518,
title = {Online Learning in Stackelberg Games with an Omniscient Follower},
author = {Geng Zhao and Banghua Zhu and Jiantao Jiao and Michael I. Jordan},
journal= {arXiv preprint arXiv:2301.11518},
year = {2023}
}