中文

合作多智能体强化学习的初始介绍

机器学习 2025-05-22 v5 多智能体系统

摘要

多智能体强化学习 (MARL) 在最近几年中风靡一时。虽然已developed了许多方法,但可以大致分为三类主要类型:集中训练与执行 (CTE)、集中训练以无中心执行 (CTDE) 和无中心训练与执行 (DTE)。CTE 方法假设在训练和执行期间进行集中化(例如,使用快速、免费且完美的通信),在执行期间拥有最多的信息。CTDE 方法最为常见,因为它们在训练期间利用集中信息,同时支持无中心执行——仅使用该代理在执行期间可用的信息。无中心训练与执行方法做出最少的假设,往往容易实现。这篇文字是关于合作 MARL 的介绍,即所有代理共享单个联合奖励的 MARL。旨在解释设置、基本概念以及 CTE、CTDE 和 DTE 设置下的常见方法。它不涵盖合作 MARL 中的所有工作,因为该领域相当广泛。我包括了我认为理解该领域的主要概念的重要工作,并为我所遗漏的工作表示歉意。主题包括将单智能体方法简单应用于 CTE 以及一些更可扩展的方法,这些方法利用多智能体结构、独立 Q 学习和策略梯度方法及其扩展,以及价值函数分解方法,包括著名的 VDN、QMIX 和 QPLEX 方法,以及集中评论方法,包括 MADDPG、COMA 和 MAPPO。我还讨论了常见的误解、不同方法之间的关系以及一些开放问题。

关键词

引用

@article{arxiv.2405.06161,
  title  = {An Initial Introduction to Cooperative Multi-Agent Reinforcement Learning},
  author = {Christopher Amato},
  journal= {arXiv preprint arXiv:2405.06161},
  year   = {2025}
}