中文

网络上分布式强化学习策略评估的完全异步方案

机器学习 2021-01-25 v3 多智能体系统 最优化与控制 机器学习

摘要

本文针对有向点对点网络上的分布式强化学习(DisRL)策略评估问题,提出了一种\emph{完全异步}方案。每个节点无需等待网络中任何其他节点,即可随时利用来自邻居的(可能延迟的)信息局部更新其值函数。这与基于gossip的方案形成鲜明对比,后者中一对节点需同时更新。尽管完全异步设定涉及困难的多时间尺度决策问题,我们设计了一种基于新颖随机平均梯度(SAG)的分布式算法,并提出了推送-拉取增广图方法,以证明其以O(ck)\mathcal{O}(c^k)的线性速率精确收敛,其中c(0,1)c\in(0,1)kk每在某节点上发生一次更新便增加一。最后,数值实验验证了我们的方法相对于节点数量呈线性加速,并且对掉队节点具有鲁棒性。

关键词

引用

@article{arxiv.2003.00433,
  title  = {Fully Asynchronous Policy Evaluation in Distributed Reinforcement Learning over Networks},
  author = {Xingyu Sha and Jiaqi Zhang and Keyou You and Kaiqing Zhang and Tamer Başar},
  journal= {arXiv preprint arXiv:2003.00433},
  year   = {2021}
}