中文

零和博弈中的快速而激烈学习:步长不衰减而遗憾衰减

计算机科学与博弈论 2019-05-14 v1 机器学习 多智能体系统

摘要

据我们所知,我们首次表明在零和博弈的在线学习中,有可能调和两个看似矛盾的目标:时间平均遗憾衰减与步长不衰减。这一现象,我们称之为博弈中的“快速而激烈”学习,为极大极小优化和多智能体系统中何为可能设立了新基准。我们的分析不依赖于引入精心定制的动态。相反,我们关注研究最广泛的在线动态——梯度下降。类似地,我们关注最简单的教科书式博弈类:两智能体两策略零和博弈,如Matching Pennies。即使对于这个最简单的基准,在我们工作之前,总遗憾的最佳已知界是平凡的O(T)O(T),它甚至可立即适用于非学习智能体。基于对偶空间中非平衡轨迹几何的严密理解,我们证明了Θ(T)\Theta(\sqrt{T})的遗憾界,与在线设定中自适应步长的著名最优界相匹配。该保证对所有固定步长成立,无需提前知道时间范围并相应调整固定步长。作为推论,我们确立即使采用固定学习率,混合策略和时间平均效用也收敛到其精确的纳什均衡值。

关键词

引用

@article{arxiv.1905.04532,
  title  = {Fast and Furious Learning in Zero-Sum Games: Vanishing Regret with Non-Vanishing Step Sizes},
  author = {James P. Bailey and Georgios Piliouras},
  journal= {arXiv preprint arXiv:1905.04532},
  year   = {2019}
}