多智能体强化学习的迭代更新与统一表示
机器学习
2019-08-20 v1 人工智能
摘要
多智能体系统在合作与竞争任务中有广泛应用。随着智能体数量增加,多智能体强化学习(MARL)中的非平稳性愈发严重,给学习过程带来极大困难。此外,当前主流算法为每个智能体配置独立网络,使得内存占用随智能体数量线性增长,极大拖慢了与环境的交互。受生成对抗网络(GAN)启发,本文提出一种迭代更新方法(IU)以稳定非平稳环境。进一步,我们加入第一人称视角,并用单一网络表示所有智能体,从而将智能体策略由顺序计算转为批量计算。类似于持续终身学习,我们在该统一表示网络中实现了迭代更新方法(IUUR)。在该方法中,迭代更新可极大缓解环境的非平稳性,统一表示可加速与环境的交互并避免内存占用的线性增长。此外,该方法不影响分散执行与分布式部署。实验表明,与 MADDPG 相比,我们的算法取得了最先进的性能,并在智能体更多时大幅节省实际运行时间。
引用
@article{arxiv.1908.06758,
title = {Iterative Update and Unified Representation for Multi-Agent Reinforcement Learning},
author = {Jiancheng Long and Hongming Zhang and Tianyang Yu and Bo Xu},
journal= {arXiv preprint arXiv:1908.06758},
year = {2019}
}