中文

基于能量的惊喜最小化用于多智能体价值分解

机器学习 2021-01-19 v4 多智能体系统 机器学习

摘要

多智能体强化学习(MARL)通过利用价值分解方法,在以集中方式训练分散策略方面已展现出显著成功。然而,在虚假状态下处理惊喜以及近似偏差仍是多智能体设定中尚未解决的问题。为此,我们提出了基于能量的MIXer(EMIX),一种利用智能体间能量来最小化惊喜的算法。我们的贡献有三方面:(1) EMIX在多智能体部分可观测设定下提出了一种新颖的跨多智能体惊喜最小化技术。(2) EMIX突出了能量函数在MARL中的实际用途,并给出了能量算子的理论保证与实验验证。最后,(3) EMIX扩展了Maxmin Q-learning,以解决MARL中跨智能体的过高估计偏差。在具有挑战性的星际争霸II微操场景研究中,EMIX在多智能体惊喜最小化方面表现出持续稳定的性能。此外,我们的消融研究凸显了基于能量方案的必要性,以及消除MARL中过高估计偏差的需求。我们对EMIX的实现可在 karush17.github.io/emix-web/ 找到。

关键词

引用

@article{arxiv.2009.09842,
  title  = {Energy-based Surprise Minimization for Multi-Agent Value Factorization},
  author = {Karush Suri and Xiao Qi Shi and Konstantinos Plataniotis and Yuri Lawryshyn},
  journal= {arXiv preprint arXiv:2009.09842},
  year   = {2021}
}

备注

Preprint, Under Review