中文

多智能体强化学习的 K 级策略梯度

机器学习 2025-09-16 v1 人工智能

摘要

深度多智能体强化学习 (MARL) 中的演员-评论家算法通常采用针对其他智能体当前策略的响应式策略更新。虽然这种方法直观,但未能考虑其他智能体在同一更新步骤中的更新,导致协调不当。本文引入了 K 级策略梯度 (KPG),一种递归更新每个智能体以应对其他智能体已更新策略的方法,加速了有效协同策略的发现。我们在某些条件下证明,KPG 在有限迭代次数下的单调收敛于局部纳什均衡。我们通过将其应用于深度 MARL 算法 MAPPO、MADDPG 和 FACMAC 提供了 KPG 的原则性实现。实验上,我们在星际争霸 II 和多智能体 MuJoCo 中证明其优于现有深度 MARL 算法的性能。

关键词

引用

@article{arxiv.2509.12117,
  title  = {$K$-Level Policy Gradients for Multi-Agent Reinforcement Learning},
  author = {Aryaman Reddi and Gabriele Tiboni and Jan Peters and Carlo D'Eramo},
  journal= {arXiv preprint arXiv:2509.12117},
  year   = {2025}
}