中文

博弈中的对冲:外部后悔与交换后悔的更快收敛

计算机科学与博弈论 2020-10-21 v2 数据结构与算法

摘要

我们考虑玩家运行Hedge算法或其乐观变体来重复进行nn行动博弈、共TT轮的设置。1)对于双人博弈,我们证明乐观Hedge的后悔以O~(1/T5/6)\tilde{O}( 1/T ^{5/6} )衰减,改进了Syrgkanis、Agarwal、Luo与Schapire(NIPS'15)先前的界O(1/T3/4)O(1/T^{3/4})。2)相反,我们证明原始Hedge的收敛速率不优于Ω~(1/T)\tilde{\Omega}(1/ \sqrt{T}),解决了Syrgkanis、Agarwal、Luo与Schapire(NIPS'15)中提出的开放问题。对于一般mm人博弈,我们证明当玩家将乐观Hedge与Blum和Mansour(JMLR'07)经典的外部到内部后悔归约结合时,各玩家的交换后悔以O~(m1/2(n/T)3/4)\tilde{O}(m^{1/2} (n/T)^{3/4})的速率衰减。该算法也可被修改以对自身达到相同速率,并对对手达到O~(n/T)\tilde{O}(\sqrt{n/T})的速率。通过标准联系,我们的上界也意味着双人博弈中至粗相关均衡与多人博弈中至相关均衡的更快收敛。

关键词

引用

@article{arxiv.2006.04953,
  title  = {Hedging in games: Faster convergence of external and swap regrets},
  author = {Xi Chen and Binghui Peng},
  journal= {arXiv preprint arXiv:2006.04953},
  year   = {2020}
}