中文

利用Polyak步长自适应增强策略梯度

机器学习 2024-04-12 v1

摘要

策略梯度是强化学习领域广泛使用的基础算法。以其收敛保证和相比其他RL算法的稳定性而闻名,但其实际应用常受超参数敏感性影响,尤其是步长。本文介绍了在强化学习中集成Polyak步长的方法,该方法无需先验知识即可自动调整步长。为将该方法适应强化学习设置,我们解决了若干问题,包括Polyak步长中未知的f*。此外,我们通过实验展示了Polyak步长在强化学习中的性能,证明了更快的收敛速度和更稳定策略的获得。

关键词

引用

@article{arxiv.2404.07525,
  title  = {Enhancing Policy Gradient with the Polyak Step-Size Adaption},
  author = {Yunxiang Li and Rui Yuan and Chen Fan and Mark Schmidt and Samuel Horváth and Robert M. Gower and Martin Takáč},
  journal= {arXiv preprint arXiv:2404.07525},
  year   = {2024}
}