ACCNet:基于深度多智能体强化学习的“学习通信”Actor-Coordinator-Critic 网络
人工智能
2017-10-31 v3 机器学习
摘要
通信是庞大的多智能体世界保持组织性和生产力的关键因素。通常,以往大多数多智能体“学习通信”研究试图预定义通信协议,或使用表格强化学习和进化算法等技术,这些方法无法泛化到不断变化的环境或大规模智能体集合。在本文中,我们提出了一种 Actor-Coordinator-Critic Net (ACCNet) 框架来解决“学习通信”问题。ACCNet 将强大的 actor-critic 强化学习技术与深度学习技术自然结合。它甚至可以在部分可观测环境下从零开始高效学习通信协议。我们证明了 ACCNet 在连续和离散动作空间环境下均能取得比多个基线更好的结果。我们还分析了学习到的协议并讨论了一些设计考量。
关键词
引用
@article{arxiv.1706.03235,
title = {ACCNet: Actor-Coordinator-Critic Net for "Learning-to-Communicate" with Deep Multi-agent Reinforcement Learning},
author = {Hangyu Mao and Zhibo Gong and Yan Ni and Zhen Xiao},
journal= {arXiv preprint arXiv:1706.03235},
year = {2017}
}
备注
V3 of original submission. Actor-Critic Method for Multi-agent Learning-to-Communicate based on Deep Reinforcement Learning, It is suitable for both continuous and discrete action space environments