快速随机策略梯度:用于强化学习的负动量
机器学习
2024-05-22 v1
摘要
随机优化算法,尤其是随机策略梯度(SPG),在强化学习(RL)中取得了显著成功。然而,迄今为止,如何快速获得 RL 的最优解仍是一个挑战。为了解决这个问题,本文从利用动量的角度开发了一种快速 SPG 算法,命名为 SPG-NM。具体而言,在 SPG-NM 中,一种新型负动量(NM)技术被应用于经典 SPG 算法。与现有的 NM 技术不同,我们的 SPG-NM 算法采用了少量超参数。此外,其计算复杂度与现代 SPG 类算法(例如将 Nesterov 加速梯度(NAG)与 SPG 相结合的加速策略梯度(APG))几乎相同。我们在两个经典任务(赌博机设置和马尔可夫决策过程(MDP))上对所得算法进行了评估。不同任务中的数值结果表明,与最先进算法相比,所得算法具有更快的收敛速度,这证实了 NM 在加速 RL 的 SPG 中的积极影响。同时,不同设置下的数值实验证实了我们的 SPG-NM 算法对某些关键超参数的鲁棒性,这使得用户在实际应用中可以自由调整。
引用
@article{arxiv.2405.12228,
title = {Fast Stochastic Policy Gradient: Negative Momentum for Reinforcement Learning},
author = {Haobin Zhang and Zhuang Yang},
journal= {arXiv preprint arXiv:2405.12228},
year = {2024}
}