中文

凹 $N$ 人博弈中的赌博机学习

计算机科学与博弈论 2018-10-05 v1 机器学习 最优化与控制

摘要

本文研究了在非合作凹博弈中带有赌博机反馈的学习的长期行为。赌博机框架适用于极低信息环境,其中智能体甚至可能不知道自己正在参与博弈;因此,在此设定下智能体最合理的选择是采用无遗憾学习算法。一般而言,这并不意味着参与者的行为在长期内会稳定下来:即使拥有完美的梯度信息,无遗憾学习也可能导致循环。然而,若满足标准单调性条件,我们的分析表明基于镜面下降且带赌博机反馈的无遗憾学习以概率 11 收敛到纳什均衡。我们还推导了该过程收敛速度的上界,其几乎匹配单智能体赌博机随机优化的最佳可达速率。

关键词

引用

@article{arxiv.1810.01925,
  title  = {Bandit learning in concave $N$-person games},
  author = {Mario Bravo and David S. Leslie and Panayotis Mertikopoulos},
  journal= {arXiv preprint arXiv:1810.01925},
  year   = {2018}
}

备注

24 pages, 1 figure