更集中的训练,仍是分散的执行:多智能体条件策略分解
机器学习
2023-02-13 v2 多智能体系统
摘要
在协作多智能体强化学习(MARL)中,将值分解与 actor-critic 相结合使智能体能够学习随机策略,这更适用于部分可观测环境。鉴于学习支持分散执行的局部策略这一目标,即便在集中训练中,智能体通常也被假设彼此独立。然而,此类假设可能阻碍智能体学习最优联合策略。为解决该问题,我们在集中训练中显式考虑智能体间的依赖性。尽管这带来了最优联合策略,但其可能无法被分解为分散执行。不过,我们从理论上证明,从该联合策略出发,总能导出另一个达到相同最优性且可分解为分散执行的联合策略。为此,我们提出多智能体条件策略分解(MACPF),其采用更集中的训练但仍支持分散执行。我们在多种协作 MARL 任务中实证验证了 MACPF,并表明 MACPF 取得了优于基线或更快收敛的性能。我们的代码可在 https://github.com/PKU-RL/FOP-DMAC-MACPF 获取。
引用
@article{arxiv.2209.12681,
title = {More Centralized Training, Still Decentralized Execution: Multi-Agent Conditional Policy Factorization},
author = {Jiangxing Wang and Deheng Ye and Zongqing Lu},
journal= {arXiv preprint arXiv:2209.12681},
year = {2023}
}
备注
ICLR 2023