网络上分布式强化学习策略评估的完全异步方案
机器学习
2021-01-25 v3 多智能体系统
最优化与控制
机器学习
摘要
本文针对有向点对点网络上的分布式强化学习(DisRL)策略评估问题,提出了一种\emph{完全异步}方案。每个节点无需等待网络中任何其他节点,即可随时利用来自邻居的(可能延迟的)信息局部更新其值函数。这与基于gossip的方案形成鲜明对比,后者中一对节点需同时更新。尽管完全异步设定涉及困难的多时间尺度决策问题,我们设计了一种基于新颖随机平均梯度(SAG)的分布式算法,并提出了推送-拉取增广图方法,以证明其以的线性速率精确收敛,其中且每在某节点上发生一次更新便增加一。最后,数值实验验证了我们的方法相对于节点数量呈线性加速,并且对掉队节点具有鲁棒性。
引用
@article{arxiv.2003.00433,
title = {Fully Asynchronous Policy Evaluation in Distributed Reinforcement Learning over Networks},
author = {Xingyu Sha and Jiaqi Zhang and Keyou You and Kaiqing Zhang and Tamer Başar},
journal= {arXiv preprint arXiv:2003.00433},
year = {2021}
}