具有随机扰动收益观测的博弈中学习的鲁棒性
最优化与控制
2016-06-03 v2 计算机科学与博弈论
概率论
机器学习
摘要
受博弈论实际应用中精确收益反馈稀缺性的驱动,我们研究了一类学习动力学,其中参与者基于受噪声和随机扰动影响的过往收益观测来调整其选择。首先,在单人情形(对应于一个试图适应任意变化环境的智能体)中,我们证明所研究的随机动力学几乎必然导致无悔,无论参与者观测中的噪声水平如何。在多人情形中,我们发现严格劣策略会灭绝,并证明严格纳什均衡是随机稳定且具有吸引性的;反之,如果一个状态以正概率稳定或具有吸引性,那么它就是一个纳什均衡。最后,我们为两人博弈提供了一个平均化原理,并证明在具有内部均衡的零和博弈中,对于任何噪声水平,时间平均都会收敛到纳什均衡。
引用
@article{arxiv.1412.6565,
title = {On the robustness of learning in games with stochastically perturbed payoff observations},
author = {Mario Bravo and Panayotis Mertikopoulos},
journal= {arXiv preprint arXiv:1412.6565},
year = {2016}
}
备注
36 pages, 4 figures