中文

通信高效的并行强化学习

机器学习 2021-02-23 v1 人工智能 多智能体系统

摘要

我们考虑如下问题:MM 个智能体使用强化学习与 MM 个相同且独立的环境(具有 SS 个状态和 AA 个动作)交互 TT 轮。智能体将其数据与中央服务器共享以最小化其遗憾值。我们旨在找到一种算法,使智能体能以不频繁的通信轮次最小化遗憾值。我们提供 \NAM\,其在每个智能体上运行,并证明对于直径为 DD、状态数为 SS、动作数为 AA 的马尔可夫决策过程,MM 个智能体的总累积遗憾值上界为 \TildeO(DSMAT)\Tilde{O}(DS\sqrt{MAT})。智能体在其对任意状态-动作对的访问次数超过某一阈值后进行同步。由此,我们得到总通信轮数上界为 O(MSAlog(MT))O\left(MSA\log(MT)\right)。最后,我们在多种环境下评估该算法,表明所提算法性能与始终通信版本的 UCRL2 算法相当,而通信量显著更低。

关键词

引用

@article{arxiv.2102.10740,
  title  = {Communication Efficient Parallel Reinforcement Learning},
  author = {Mridul Agarwal and Bhargav Ganguly and Vaneet Aggarwal},
  journal= {arXiv preprint arXiv:2102.10740},
  year   = {2021}
}