一般和重复矩阵博弈中近最优的在线平等主义学习
机器学习
2019-06-05 v1 计算机科学与博弈论
摘要
我们研究双人一般和重复有限博弈,其中每位玩家的奖励由未知分布生成。我们的目标是为重复博弈找到平等主义议价解 (EBS),其可带来比两位玩家的最大最小值高得多的奖励。我们最重要的贡献是推导出一种算法,该算法在任意 轮博弈后,对两位玩家同时实现高概率后悔界 。我们通过证明任意算法的下界 来表明我们的上界是近最优的。
引用
@article{arxiv.1906.01609,
title = {Near-Optimal Online Egalitarian learning in General Sum Repeated Matrix Games},
author = {Aristide Tossou and Christos Dimitrakakis and Jaroslaw Rzepecki and Katja Hofmann},
journal= {arXiv preprint arXiv:1906.01609},
year = {2019}
}