中文

面向多智能体强化学习的 Shapley 反事实信用分配

人工智能 2022-01-25 v4 多智能体系统

摘要

集中训练与分散执行(CTDE)在合作型多智能体强化学习(MARL)中是一种流行的范式,并广泛应用于许多实际场景中。训练过程中的主要挑战之一是信用分配,旨在根据全局奖励推断每个智能体的贡献。现有的信用分配方法要么侧重于将联合价值函数分解为个体价值函数,要么衡量局部观测与动作对全局价值函数的影响。这些方法缺乏对多个智能体之间复杂交互的充分考虑,导致不恰当的信用分配,进而在 MARL 上取得平庸的结果。我们提出 Shapley 反事实信用分配,一种考虑智能体联盟的显式信用分配新方法。具体而言,在深度 MARL 中利用 Shapley 值及其期望性质对任何智能体组合进行信用分配,这赋予我们估计每个智能体个体信用的能力。尽管有此能力,主要技术难点在于 Shapley 值的计算复杂度随智能体数量阶乘增长。我们转而采用基于蒙特卡洛采样的近似方法,在保持有效性的同时降低采样复杂度。我们在星际争霸 II(StarCraft II)基准的不同场景上评估了我们的方法。我们的方法显著优于现有的合作 MARL 算法并达到了最先进水平(SOTA),尤其在难度更大的任务上优势明显。

关键词

引用

@article{arxiv.2106.00285,
  title  = {Shapley Counterfactual Credits for Multi-Agent Reinforcement Learning},
  author = {Jiahui Li and Kun Kuang and Baoxiang Wang and Furui Liu and Long Chen and Fei Wu and Jun Xiao},
  journal= {arXiv preprint arXiv:2106.00285},
  year   = {2022}
}