具有量化收益观测的博弈学习
计算机科学与博弈论
2022-09-13 v1
摘要
本文研究了反馈量化对多智能体学习的影响。具体而言,我们分析了著名的“跟随正则化领导者”(FTRL)类算法在玩家只能观测到其收益的量化(且可能含噪)版本时的均衡收敛性质。在这一信息受限设定下,我们表明更粗的量化会引发 FTRL 方案收敛行为的定性转变。特别地,若量化误差低于一个阈值(该阈值仅依赖于底层博弈,而不依赖于进入过程的不确定性水平或所研究的具体 FTRL 变体),则(i)FTRL 以任意高概率被吸引至博弈的严格纳什均衡;且(ii)算法的渐近收敛速率与非量化情形保持一致。否则,对于更大的量化水平,这些收敛性质完全丧失:玩家可能除初始状态外学不到任何东西,即便拥有其收益向量的完全信息。这与连续优化问题中量化的影响形成对比,在后者中所得解的质量随量化水平平滑退化。
引用
@article{arxiv.2209.04926,
title = {Learning in Games with Quantized Payoff Observations},
author = {Kyriakos Lotidis and Panayotis Mertikopoulos and Nicholas Bambos},
journal= {arXiv preprint arXiv:2209.04926},
year = {2022}
}