在多智能体深度强化学习中通过策略正则化促进协调
机器学习
2020-11-10 v4 多智能体系统
机器学习
摘要
在多智能体强化学习中,发现成功的集体行为颇具挑战,因为这需要探索随智能体数量指数增长的联合动作空间。尽管独立智能体式探索的易处理性颇具吸引力,但该方法在需要精细群体策略的任务上会失败。我们认为协调各智能体的策略可引导其探索,并研究了促进此类归纳偏置的技术。我们提出两种策略正则化方法:基于智能体间动作可预测性的 TeamReg,以及依赖同步行为选择的 CoachReg。我们在四个具有稀疏奖励、需要不同协调程度的连续控制任务以及离散动作 Google Research Football 环境中评估了每种方法。我们的实验显示在许多合作多智能体问题上性能得到提升。最后,我们分析了所提方法对智能体所学策略的影响,并表明我们的方法成功强化了我们所提出的作为协调行为代理指标的特性。
引用
@article{arxiv.1908.02269,
title = {Promoting Coordination through Policy Regularization in Multi-Agent Deep Reinforcement Learning},
author = {Julien Roy and Paul Barde and Félix G. Harvey and Derek Nowrouzezahrai and Christopher Pal},
journal= {arXiv preprint arXiv:1908.02269},
year = {2020}
}
备注
23 pages, 16 figures. This revised version contains additional results and minor edits