面向高效分布式强化学习的异步策略梯度聚合
机器学习
2026-03-31 v2 分布式、并行与集群计算
最优化与控制
摘要
我们研究了在异步并行计算和通信环境下的分布式强化学习中的策略梯度方法。虽然非分布式方法在理论上已得到良好理解,并在实践中取得了显著的经验成功,但其分布式对等物仍受到较少探索,尤其是在存在异构异步计算和通信瓶颈的情况下。我们引入两种新算法,分别称为 Rennala NIGT 和 Malenia NIGT,实现了异步策略梯度聚合,实现了最新的效率。 在均匀设置下,Rennala NIGT 在总计算和通信复杂度方面具有可证明的改进,同时支持 AllReduce 操作。在异构设置下,Malenia NIGT 同时处理异步计算和异构环境,具有更严格的理论保证。我们的结果得到实验的进一步证实,显示我们的方法在各类方法上都有显著优势。
引用
@article{arxiv.2509.24305,
title = {Asynchronous Policy Gradient Aggregation for Efficient Distributed Reinforcement Learning},
author = {Alexander Tyurin and Andrei Spiridonov and Varvara Rudenko},
journal= {arXiv preprint arXiv:2509.24305},
year = {2026}
}