中文

通过通信最小化学习近可分解值函数

机器学习 2020-07-21 v2 机器学习

摘要

强化学习在多智能体环境中面临可扩展性和非平稳性等重大挑战。近来,值函数分解学习成为解决协作多智能体系统这些挑战的一种有前景的方法。然而,现有方法一直聚焦于学习完全去中心化的值函数,这对于需要通信的任务并不高效。为应对此局限,本文提出一种通过通信最小化学习近可分解 Q 函数(NDQ)的新框架,智能体大多数时间自主行动,但偶尔向其他智能体发送消息以实现有效协调。该框架通过引入两个信息论正则化项,将值函数分解学习与通信学习相混合。这些正则化项在最大化智能体动作选择与通信消息之间互信息的同时,最小化智能体间消息的熵。我们展示了如何优化这些正则化项,使其易于与 QMIX 等现有值函数分解方法集成。最后,我们证明在 StarCraft 单位微操基准上,我们的框架显著优于基线方法,并能在不牺牲性能的前提下削减超过 80%80\% 的通信。我们的实验视频见 https://sites.google.com/view/ndq。

关键词

引用

@article{arxiv.1910.05366,
  title  = {Learning Nearly Decomposable Value Functions Via Communication Minimization},
  author = {Tonghan Wang and Jianhao Wang and Chongyi Zheng and Chongjie Zhang},
  journal= {arXiv preprint arXiv:1910.05366},
  year   = {2020}
}

备注

8th International Conference on Learning Representations (ICLR 2020)