合作多智能体强化学习中集中式训练分布式执行导论
机器学习
2024-12-22 v1 多智能体系统
摘要
近年来,多智能体强化学习 (MARL) 的热度激增。目前已开发出许多方法,但它们可分为三大类:集中式训练与执行 (CTE)、集中式训练分布式执行 (CTDE) 以及分布式训练与执行 (DTE)。CTDE 方法最为常见,因为它们可以在训练期间利用集中式信息,但以分布式方式执行——在执行时仅使用该智能体可获取的信息。CTDE 是唯一需要一个独立训练阶段的范式,在该阶段可以使用任何可用信息(例如,其他智能体的策略、底层状态)。因此,它们比 CTE 方法具有更好的可扩展性,在执行期间不需要通信,并且通常表现良好。CTDE 最自然地适用于合作场景,但根据假设可观察到的信息,也可潜在地应用于竞争或混合环境。本文是关于合作 MARL 中 CTDE 的导论。旨在解释其设定、基本概念和常用方法。由于该子领域相当广泛,本文并未涵盖 CTDE MARL 的所有工作。我收录了那些我认为对理解该子领域核心概念至关重要的工作,并向被遗漏的作者致歉。
引用
@article{arxiv.2409.03052,
title = {An Introduction to Centralized Training for Decentralized Execution in Cooperative Multi-Agent Reinforcement Learning},
author = {Christopher Amato},
journal= {arXiv preprint arXiv:2409.03052},
year = {2024}
}
备注
arXiv admin note: substantial text overlap with arXiv:2405.06161