中文

ACCNet:基于深度多智能体强化学习的“学习通信”Actor-Coordinator-Critic 网络

人工智能 2017-10-31 v3 机器学习

摘要

通信是庞大的多智能体世界保持组织性和生产力的关键因素。通常,以往大多数多智能体“学习通信”研究试图预定义通信协议,或使用表格强化学习和进化算法等技术,这些方法无法泛化到不断变化的环境或大规模智能体集合。在本文中,我们提出了一种 Actor-Coordinator-Critic Net (ACCNet) 框架来解决“学习通信”问题。ACCNet 将强大的 actor-critic 强化学习技术与深度学习技术自然结合。它甚至可以在部分可观测环境下从零开始高效学习通信协议。我们证明了 ACCNet 在连续和离散动作空间环境下均能取得比多个基线更好的结果。我们还分析了学习到的协议并讨论了一些设计考量。

关键词

引用

@article{arxiv.1706.03235,
  title  = {ACCNet: Actor-Coordinator-Critic Net for "Learning-to-Communicate" with Deep Multi-agent Reinforcement Learning},
  author = {Hangyu Mao and Zhibo Gong and Yan Ni and Zhen Xiao},
  journal= {arXiv preprint arXiv:1706.03235},
  year   = {2017}
}

备注

V3 of original submission. Actor-Critic Method for Multi-agent Learning-to-Communicate based on Deep Reinforcement Learning, It is suitable for both continuous and discrete action space environments