中文

合作-竞争智能体的独立强化学习:平均场视角

机器学习 2025-02-11 v2 人工智能 计算机科学与博弈论 多智能体系统

摘要

在本文中,我们研究分组为团队的智能体之间的强化学习(RL),使得每个团队内部存在合作,而不同团队之间存在一般和(非零和)竞争。为了开发一种可证明达到Nash均衡的RL方法,我们关注线性二次(LQ)结构。此外,为了解决有限种群设定中多智能体交互引起的非平稳性,我们考虑每个团队内智能体数量为无限的情况,即平均场设定。这形成了一般和LQ平均场类型博弈(GS-MFTG)。在标准可逆性条件下,我们刻画了GS-MFTG的Nash均衡(NE)。然后证明,对于每个团队中智能体数量下界为MM的有限种群博弈,该MFTG NE是其 O(1/M)O(1/M)-NE。这些结构性结果激发了一种名为Multi-player Receding-horizon Natural Policy Gradient (MRNPG) 的算法,其中每个团队以滚动时域的方式独立最小化其累积成本。尽管问题具有非凸性,我们通过使用后向递归离散时间Hamilton-Jacobi-Isaacs (HJI) 方程将问题新颖地分解为子问题,证明了所得算法能收敛到全局NE,其中证明了独立自然策略梯度在时间无关的对角占优条件下表现出线性收敛。包含的数值研究证实了理论结果。

关键词

引用

@article{arxiv.2403.11345,
  title  = {Independent RL for Cooperative-Competitive Agents: A Mean-Field Perspective},
  author = {Muhammad Aneeq uz Zaman and Alec Koppel and Mathieu Laurière and Tamer Başar},
  journal= {arXiv preprint arXiv:2403.11345},
  year   = {2025}
}