中文

随机博弈中的梯度博弈:驻点、收敛性与样本复杂度

机器学习 2023-12-08 v5 计算机科学与博弈论 多智能体系统 最优化与控制

摘要

我们研究了随机博弈(SGs)中梯度博弈算法的性能,其中每个智能体试图通过基于智能体间共享的当前状态信息独立决策来最大化自身的累积折扣奖励。策略直接由在给定状态下选择某动作的概率参数化。我们证明了在此设定下纳什均衡(NEs)与一阶驻点策略等价,并给出了严格纳什均衡附近的局部收敛速率。进一步,对于一类称为马尔可夫势博弈(包含相同奖励设定作为重要特例)的SGs子类,我们设计了一种基于采样的强化学习算法,并对精确梯度博弈与我们的基于采样的学习算法给出了非渐近的全局收敛速率分析。我们的结果表明,达到一个ϵ\epsilon-NE所需的迭代次数随智能体数量线性而非指数增长。我们也考虑了局部几何与局部稳定性,证明了严格纳什均衡是总势函数的局部极大值,而完全混合纳什均衡是鞍点。

关键词

引用

@article{arxiv.2106.00198,
  title  = {Gradient play in stochastic games: stationary points, convergence, and sample complexity},
  author = {Runyu Zhang and Zhaolin Ren and Na Li},
  journal= {arXiv preprint arXiv:2106.00198},
  year   = {2023}
}