凹 $N$ 人博弈中的赌博机学习
计算机科学与博弈论
2018-10-05 v1 机器学习
最优化与控制
摘要
本文研究了在非合作凹博弈中带有赌博机反馈的学习的长期行为。赌博机框架适用于极低信息环境,其中智能体甚至可能不知道自己正在参与博弈;因此,在此设定下智能体最合理的选择是采用无遗憾学习算法。一般而言,这并不意味着参与者的行为在长期内会稳定下来:即使拥有完美的梯度信息,无遗憾学习也可能导致循环。然而,若满足标准单调性条件,我们的分析表明基于镜面下降且带赌博机反馈的无遗憾学习以概率 收敛到纳什均衡。我们还推导了该过程收敛速度的上界,其几乎匹配单智能体赌博机随机优化的最佳可达速率。
引用
@article{arxiv.1810.01925,
title = {Bandit learning in concave $N$-person games},
author = {Mario Bravo and David S. Leslie and Panayotis Mertikopoulos},
journal= {arXiv preprint arXiv:1810.01925},
year = {2018}
}
备注
24 pages, 1 figure