在具有独立链的 $n$ 人随机博弈中学习平稳纳什均衡策略
机器学习
2023-03-23 v4 计算机科学与博弈论
多智能体系统
系统与控制
系统与控制
最优化与控制
摘要
我们考虑 人随机博弈的一个子类,其中玩家拥有各自的内部状态/动作空间,但通过收益函数相互耦合。假设玩家的内部链由独立的转移概率驱动。此外,玩家只能接收到其收益的实现值而非实际函数,且无法观测彼此的状态/动作。对于此类博弈,我们首先证明在不对收益函数作任何假设的情况下寻找平稳纳什均衡(NE)策略是不可处理的。然而,对于一般收益函数,我们开发了基于对偶平均与对偶镜像下降的多项式时间学习算法,这些算法在平均 Nikaido-Isoda 距离意义上几乎必然或依期望收敛到 -NE 策略集合。特别地,在收益函数上的额外假设(如社会凹性)下,我们推导出以高概率达到 -NE 策略所需迭代次数的多项式上界。最后,我们通过智能电网能量管理的数值实验评估了所提算法在学习 -NE 策略上的有效性。
引用
@article{arxiv.2201.12224,
title = {Learning Stationary Nash Equilibrium Policies in $n$-Player Stochastic Games with Independent Chains},
author = {S. Rasoul Etesami},
journal= {arXiv preprint arXiv:2201.12224},
year = {2023}
}