中文

使用双重中心化评论家减少多智能体领域中的过高估计偏差

机器学习 2019-12-03 v2 人工智能 多智能体系统 机器学习

摘要

许多现实世界的任务需要多个智能体协同工作。近年来已提出多智能体强化学习(RL)方法来解决这些任务,但当前方法往往无法高效地学习策略。因此我们研究了单智能体 RL 中一个常见弱点,即值函数过高估计偏差,在多智能体设置中的存在情况。基于我们的发现,我们提出了一种通过使用双重中心化评论家来减少该偏差的方法。我们在六个混合合作-竞争任务上对其进行了评估,显示出相对于当前方法的显著优势。最后,我们研究了多智能体方法在高维机器人任务上的应用,并表明我们的方法可用于在该领域中学习去中心化策略。

关键词

引用

@article{arxiv.1910.01465,
  title  = {Reducing Overestimation Bias in Multi-Agent Domains Using Double Centralized Critics},
  author = {Johannes Ackermann and Volker Gabler and Takayuki Osa and Masashi Sugiyama},
  journal= {arXiv preprint arXiv:1910.01465},
  year   = {2019}
}

备注

Accepted for the Deep RL Workshop at NeurIPS 2019; Changes for v2: Changed Figures 3,4, due to an error in the implementation of MATD3. Please refer to this version for fair evaluation