中文

多智能体强化学习中集中式与分散式评论家的对比

机器学习 2021-12-06 v2 人工智能

摘要

用于分散执行的集中式训练(即智能体离线使用集中式信息进行训练,但在线以分散式方式执行)在多智能体强化学习社区中已颇受欢迎。特别地,带有集中式评论家和分散式行动者的行动者-评论家方法是这一思想的常见实例。然而,尽管集中式评论家是许多算法的标准选择,在此背景下使用集中式评论家的影响尚未被充分讨论和理解。因此我们形式化地分析了集中式和分散式评论家方法,从而更深入地理解评论家选择的影响。由于我们的理论做了不切实际的假设,我们还在广泛的一组环境中经验性地比较了集中式和分散式评论家方法,以验证我们的理论并提供实用建议。我们表明当前文献中关于集中式评论家存在误解,并证明集中式评论家设计并非严格有益,而是集中式和分散式评论家各有不同的优缺点,算法设计者应当加以考虑。

关键词

引用

@article{arxiv.2102.04402,
  title  = {Contrasting Centralized and Decentralized Critics in Multi-Agent Reinforcement Learning},
  author = {Xueguang Lyu and Yuchen Xiao and Brett Daley and Christopher Amato},
  journal= {arXiv preprint arXiv:2102.04402},
  year   = {2021}
}