面向鲁棒多智能体深度强化学习的局部优势 Actor-Critic
机器学习
2021-12-21 v3 人工智能
多智能体系统
摘要
策略梯度方法在多智能体强化学习中已变得流行,但由于环境随机性和探索性智能体(即非平稳性)的存在,它们面临高方差问题,而信用分配困难可能进一步加剧该问题。因此,需要一种不仅能高效解决上述两个问题,而且足够鲁棒以应对多种任务的方法。为此,我们提出一种新的多智能体策略梯度方法,称为鲁棒局部优势(ROLA)Actor-Critic。ROLA 允许每个智能体学习一个个体动作值函数作为局部评论家,并通过基于集中式评论家的新型集中式训练方法改善环境非平稳性。通过使用该局部评论家,每个智能体计算一个基线以降低其策略梯度估计的方差,从而产生对其他智能体选择的期望优势动作值,隐式地改善了信用分配。我们在多种基准上评估 ROLA,并展示了其相对于许多最先进多智能体策略梯度算法的鲁棒性和有效性。
引用
@article{arxiv.2110.08642,
title = {Local Advantage Actor-Critic for Robust Multi-Agent Deep Reinforcement Learning},
author = {Yuchen Xiao and Xueguang Lyu and Christopher Amato},
journal= {arXiv preprint arXiv:2110.08642},
year = {2021}
}