使用双重中心化评论家减少多智能体领域中的过高估计偏差
机器学习
2019-12-03 v2 人工智能
多智能体系统
机器学习
摘要
许多现实世界的任务需要多个智能体协同工作。近年来已提出多智能体强化学习(RL)方法来解决这些任务,但当前方法往往无法高效地学习策略。因此我们研究了单智能体 RL 中一个常见弱点,即值函数过高估计偏差,在多智能体设置中的存在情况。基于我们的发现,我们提出了一种通过使用双重中心化评论家来减少该偏差的方法。我们在六个混合合作-竞争任务上对其进行了评估,显示出相对于当前方法的显著优势。最后,我们研究了多智能体方法在高维机器人任务上的应用,并表明我们的方法可用于在该领域中学习去中心化策略。
引用
@article{arxiv.1910.01465,
title = {Reducing Overestimation Bias in Multi-Agent Domains Using Double Centralized Critics},
author = {Johannes Ackermann and Volker Gabler and Takayuki Osa and Masashi Sugiyama},
journal= {arXiv preprint arXiv:1910.01465},
year = {2019}
}
备注
Accepted for the Deep RL Workshop at NeurIPS 2019; Changes for v2: Changed Figures 3,4, due to an error in the implementation of MATD3. Please refer to this version for fair evaluation