通信高效的并行强化学习
机器学习
2021-02-23 v1 人工智能
多智能体系统
摘要
我们考虑如下问题: 个智能体使用强化学习与 个相同且独立的环境(具有 个状态和 个动作)交互 轮。智能体将其数据与中央服务器共享以最小化其遗憾值。我们旨在找到一种算法,使智能体能以不频繁的通信轮次最小化遗憾值。我们提供 \NAM\,其在每个智能体上运行,并证明对于直径为 、状态数为 、动作数为 的马尔可夫决策过程, 个智能体的总累积遗憾值上界为 。智能体在其对任意状态-动作对的访问次数超过某一阈值后进行同步。由此,我们得到总通信轮数上界为 。最后,我们在多种环境下评估该算法,表明所提算法性能与始终通信版本的 UCRL2 算法相当,而通信量显著更低。
引用
@article{arxiv.2102.10740,
title = {Communication Efficient Parallel Reinforcement Learning},
author = {Mridul Agarwal and Bhargav Ganguly and Vaneet Aggarwal},
journal= {arXiv preprint arXiv:2102.10740},
year = {2021}
}