利用Polyak步长自适应增强策略梯度
机器学习
2024-04-12 v1
摘要
策略梯度是强化学习领域广泛使用的基础算法。以其收敛保证和相比其他RL算法的稳定性而闻名,但其实际应用常受超参数敏感性影响,尤其是步长。本文介绍了在强化学习中集成Polyak步长的方法,该方法无需先验知识即可自动调整步长。为将该方法适应强化学习设置,我们解决了若干问题,包括Polyak步长中未知的f*。此外,我们通过实验展示了Polyak步长在强化学习中的性能,证明了更快的收敛速度和更稳定策略的获得。
引用
@article{arxiv.2404.07525,
title = {Enhancing Policy Gradient with the Polyak Step-Size Adaption},
author = {Yunxiang Li and Rui Yuan and Chen Fan and Mark Schmidt and Samuel Horváth and Robert M. Gower and Martin Takáč},
journal= {arXiv preprint arXiv:2404.07525},
year = {2024}
}