PG-Rainbow:在策略梯度方法中采用分布式强化学习
机器学习
2024-07-22 v2 人工智能
摘要
本文介绍了PG-Rainbow,这是一种新型算法,将分布式强化学习框架与策略梯度算法相结合。现有策略梯度方法样本效率低,且仅依赖返回的均值来计算状态-动作价值函数,忽略了强化学习任务中返回分布的本质。在解决此问题方面,我们使用隐式分位网络(IPN),其提供奖励分布的分位信息,以供策略梯度算法的批评网络使用。我们展示的实验结果表明,通过将奖励分布信息整合到策略网络中,策略智能体能够更全面地评估给定状态下潜在动作的后果,从而促进更加精细和信息化的决策过程。在本研究中,我们通过 Arcade Learning Environment (ALE) 对所提算法在 Atari-2600 游戏套件上的性能进行评估。
引用
@article{arxiv.2407.13146,
title = {PG-Rainbow: Using Distributional Reinforcement Learning in Policy Gradient Methods},
author = {WooJae Jeon and KangJun Lee and Jeewoo Lee},
journal= {arXiv preprint arXiv:2407.13146},
year = {2024}
}