零和随机博弈中独立学习动力学的异质性研究
最优化与控制
2022-04-05 v2 计算机科学与博弈论
动力系统
摘要
我们分析了将经典虚拟博弈与 Q-learning 相结合的双时间尺度虚拟博弈在具有玩家相关学习率的两人零和随机博弈中的收敛性质。当折扣因子小于玩家相关步长比率的乘积时,我们在双时间尺度随机近似方法的标准假设下证明了其几乎必然收敛。为此,我们提出了一种新颖的 Lyapunov 函数构造并给出了一侧异步收敛结果。
引用
@article{arxiv.2112.06181,
title = {On the Heterogeneity of Independent Learning Dynamics in Zero-sum Stochastic Games},
author = {Muhammed O. Sayin and K. Alperen Cetiner},
journal= {arXiv preprint arXiv:2112.06181},
year = {2022}
}
备注
Extended version