有限状态马尔可夫博弈中多智能体学习动力学的均匀化
机器学习
2025-06-27 v1 机器学习
概率论
摘要
本文引入了一种新方法,用于近似在有限状态马尔可夫博弈中交互的多个强化学习(RL)智能体的学习动力学。其思想是通过同时降低学习率和增加更新频率来重新标度学习过程,从而有效地将智能体的参数视为受快速混合博弈状态影响的慢演化变量。在温和假设下——状态过程的遍历性和更新的连续性——我们证明了这种重新标度的过程收敛于一个常微分方程(ODE)。该 ODE 提供了智能体学习动力学的易处理确定性近似。该框架的实现可在以下网址获取:https://github.com/yannKerzreho/MarkovGameApproximation
引用
@article{arxiv.2506.21079,
title = {Homogenization of Multi-agent Learning Dynamics in Finite-state Markov Games},
author = {Yann Kerzreho},
journal= {arXiv preprint arXiv:2506.21079},
year = {2025}
}