中文

主从平均场多智能体强化学习

机器学习 2024-05-09 v2 多智能体系统 最优化与控制

摘要

多智能体强化学习(MARL)在扩展到大量智能体时仍然困难。近期使用平均场控制(MFC)的 MARL 为原本困难的合作型 MARL 提供了一种易处理且严谨的方法。然而,许多独立、弱交互智能体的严格 MFC 假设在实践中过于不灵活。我们将 MFC 推广为同时建模许多相似智能体与少量复杂智能体——即主从平均场控制(M3FC)。在理论上,我们给出了有限智能体控制的逼近结果,并验证了平稳策略对最优性的充分性以及动态规划原理。在算法上,我们提出了针对有限智能体系统而非极限系统的主从平均场 MARL(M3FMARL)。该算法被证明可逼近底层 M3FC MDP 的策略梯度。最后,我们在多种场景中实验展示了其能力。与最先进的策略梯度 MARL 方法相比,我们观察到强劲的性能。

关键词

引用

@article{arxiv.2303.10665,
  title  = {Major-Minor Mean Field Multi-Agent Reinforcement Learning},
  author = {Kai Cui and Christian Fabian and Anam Tahir and Heinz Koeppl},
  journal= {arXiv preprint arXiv:2303.10665},
  year   = {2024}
}

备注

Accepted to ICML 2024