稳定深度多智能体强化学习的经验回放
人工智能
2018-05-22 v3 机器学习
多智能体系统
摘要
许多现实世界问题,如网络数据包路由和城市交通控制,自然地建模为多智能体强化学习(RL)问题。然而,现有的多智能体RL方法通常在问题规模上扩展性较差。因此,一个关键挑战是将单智能体RL中深度学习的成功经验迁移到多智能体场景。一个主要障碍是,最流行的多智能体RL方法——独立Q学习——引入了非平稳性,使其与深度Q学习所依赖的经验回放记忆不兼容。本文提出了两种解决此问题的方法:1)使用多智能体变体的重要性采样来自然地衰减过时数据;2)用一个指纹来调节每个智能体的价值函数,该指纹能消除从回放记忆中采样的数据年龄的歧义。在具有挑战性的星际争霸单位微操作去中心化变体上的结果证实,这些方法能够成功地将经验回放与多智能体RL结合起来。
引用
@article{arxiv.1702.08887,
title = {Stabilising Experience Replay for Deep Multi-Agent Reinforcement Learning},
author = {Jakob Foerster and Nantas Nardelli and Gregory Farquhar and Triantafyllos Afouras and Philip H. S. Torr and Pushmeet Kohli and Shimon Whiteson},
journal= {arXiv preprint arXiv:1702.08887},
year = {2018}
}
备注
Camera-ready version, International Conference of Machine Learning 2017; updated to fix print-breaking image