Markov 势博弈中时变网络上网络化策略梯度的几乎必然收敛性
系统与控制
2025-10-02 v2 系统与控制
最优化与控制
摘要
我们提出了网络化策略梯度博弈,用于求解具有连续和/或离散状态-动作对的 Markov 势博弈。在博弈过程中,智能体使用依赖于当前状态及其他智能体策略参数的参数化可微策略。在训练期间,智能体根据随机梯度更新其策略参数。梯度估计涉及两个连续的回合,生成奖励和策略得分函数的无偏估计。此外,它还涉及利用通过时变通信网络接收到的局部估计所给出的共识步骤来保持对其他智能体参数的估计。在 Markov 势博弈中,智能体之间存在一个势值函数,其梯度对应于局部值函数的梯度。利用这一结构,我们证明了以 的速率几乎必然收敛到势值函数的驻点。与先前的工作相比,我们的结果不需要有界的策略梯度或对个体策略参数值的初始一致。在动态多智能体报童问题上的数值实验验证了局部信念和梯度的收敛性。它进一步表明,网络化策略梯度博弈的收敛速度与独立策略梯度更新一样快,同时能收集到更高的奖励。
引用
@article{arxiv.2410.20075,
title = {Almost Sure Convergence of Networked Policy Gradient over Time-Varying Networks in Markov Potential Games},
author = {Sarper Aydin and Ceyhun Eksin},
journal= {arXiv preprint arXiv:2410.20075},
year = {2025}
}
备注
15 pages, extended journal version