中文

基于团队后悔最小化的多智能体深度强化学习诱导合作

人工智能 2019-11-19 v1

摘要

现有的基于价值分解的多智能体深度强化学习(MARL)方法在集中训练与分散执行(CTDE)框架下、各类多智能体合作环境中表现良好,其中所有智能体由集中式价值网络统一训练,各智能体独立执行其策略。然而,一个未决问题在于:在集中训练过程中,当团队所处环境部分可观测或非平稳(即所有智能体的观测与动作信息无法表征全局状态)时,现有方法表现不佳且采样效率低。后悔最小化(RM)是一种有前景的方法,因其在部分可观测和完全竞争设定下表现良好。但它倾向于将其他智能体建模为对手,因此在 CTDE 框架下表现不佳。本工作中,我们提出一种新颖的基于团队 RM 的贝叶斯 MARL,包含三项关键贡献:(a)设计了一种新颖的 RM 方法,将合作智能体作为团队训练,并获得该团队的基于后悔的策略;(b)引入一种新方法将团队后悔分解,以生成各智能体分散执行所用的策略;(c)为进一步提升性能,我们利用微分粒子滤波(一种序贯蒙特卡洛方法)网络来精确估计各智能体状态。在二步矩阵博弈(合作博弈)和战斗博弈(大规模混合合作-竞争博弈)上的实验结果表明,我们的算法显著优于当前最优方法。

关键词

引用

@article{arxiv.1911.07712,
  title  = {Inducing Cooperation via Team Regret Minimization based Multi-Agent Deep Reinforcement Learning},
  author = {Runsheng Yu and Zhenyu Shi and Xinrun Wang and Rundong Wang and Buhong Liu and Xinwen Hou and Hanjiang Lai and Bo An},
  journal= {arXiv preprint arXiv:1911.07712},
  year   = {2019}
}