面向样本高效多智能体策略梯度的半同策略训练
机器学习
2021-05-07 v2 多智能体系统
摘要
策略梯度方法是解决多智能体强化学习问题的一种有吸引力的方法,因其收敛特性及在部分可观测场景中的鲁棒性。然而,在流行的星际争霸多智能体挑战(SMAC)基准上,最先进的策略梯度方法与基于值的方法之间存在显著的性能差距。在本文中,我们引入半同策略(SOP)训练,作为解决同策略策略梯度方法样本低效问题的一种有效且计算高效的方式。我们通过 SOP 训练增强了两种最先进的策略梯度算法,展示了显著的性能提升。此外,我们表明我们的方法在多种 SMAC 任务上表现与最先进的基于值的方法相当或更好。
引用
@article{arxiv.2104.13446,
title = {Semi-On-Policy Training for Sample Efficient Multi-Agent Policy Gradients},
author = {Bozhidar Vasilev and Tarun Gupta and Bei Peng and Shimon Whiteson},
journal= {arXiv preprint arXiv:2104.13446},
year = {2021}
}
备注
AAMAS Adaptive and Learning Agents Workshop. 20th International Conference on Autonomous Agents and Multiagent Systems