同利益与零和随机博弈中的最优响应动力学与虚拟博弈
计算机科学与博弈论
2022-05-17 v2
摘要
本文结合 Q-learning 与虚拟博弈的思想,定义了三种强化学习过程,它们收敛到同利益折扣随机博弈中平稳混合纳什均衡的集合。首先,我们分析了三个连续时间系统,它们推广了 Leslie 等人针对零和折扣随机博弈定义的最优响应动力学。在依赖于系统的某些假设下,这些动力学被证明收敛到同利益折扣随机博弈中平稳均衡的集合。然后,我们引入了三个类似 Sayin 等人思路的离散时间类比过程,并利用连续时间的结果结合随机逼近技术证明了它们收敛到平稳均衡的集合。一些数值实验补充了我们的理论发现。
引用
@article{arxiv.2111.04317,
title = {Best-Response Dynamics and Fictitious Play in Identical-Interest and Zero-Sum Stochastic Games},
author = {Lucas Baudin and Rida Laraki},
journal= {arXiv preprint arXiv:2111.04317},
year = {2022}
}
备注
Preprint, accepted at ICML 2022