中文

面向高效分布式强化学习的损失与奖励加权方法

机器学习 2024-08-20 v2 人工智能 分布式、并行与集群计算

摘要

本文针对强化学习(RL)环境中的分布式智能体提出了两种学习方案,即奖励加权(R-Weighted)与损失加权(L-Weighted)梯度合并方法。R/L加权方法取代了训练多个智能体的标准做法,例如对梯度求和或取平均。我们方法的核心在于,根据每个 actor 的奖励(对于 R-Weighted)或损失(对于 L-Weighted)相对于其他 actor 的高低来缩放其梯度。在训练过程中,每个智能体在具有相同环境但不同初始化版本的副本中运行,从而来自不同 actor 的梯度各异。本质上,每个智能体的 R-权重和 L-权重向其他智能体传达了其潜力,进而指示应优先学习哪个环境。这种分布式学习方法之所以可行,是因为产生较高奖励或较低损失的环境比产生较低奖励或较高损失的环境包含更关键的信息。我们通过实验证明,R-Weighted 方法在多个 RL 环境中的表现优于当前最优(state-of-the-art)方法。

关键词

引用

@article{arxiv.2304.12778,
  title  = {Loss- and Reward-Weighting for Efficient Distributed Reinforcement Learning},
  author = {Martin Holen and Per-Arne Andersen and Kristian Muri Knausgård and Morten Goodwin},
  journal= {arXiv preprint arXiv:2304.12778},
  year   = {2024}
}