中文

一般和重复矩阵博弈中近最优的在线平等主义学习

机器学习 2019-06-05 v1 计算机科学与博弈论

摘要

我们研究双人一般和重复有限博弈,其中每位玩家的奖励由未知分布生成。我们的目标是为重复博弈找到平等主义议价解 (EBS),其可带来比两位玩家的最大最小值高得多的奖励。我们最重要的贡献是推导出一种算法,该算法在任意 TT 轮博弈后,对两位玩家同时实现高概率后悔界 O(lnT3T2/3)\mathcal{O}(\sqrt[3]{\ln T}\cdot T^{2/3})。我们通过证明任意算法的下界 Ω(T2/3)\Omega(T^{2/3}) 来表明我们的上界是近最优的。

关键词

引用

@article{arxiv.1906.01609,
  title  = {Near-Optimal Online Egalitarian learning in General Sum Repeated Matrix Games},
  author = {Aristide Tossou and Christos Dimitrakakis and Jaroslaw Rzepecki and Katja Hofmann},
  journal= {arXiv preprint arXiv:1906.01609},
  year   = {2019}
}