中文

深度强化学习的动态学习率:基于 bandit 方法

机器学习 2025-10-09 v3

摘要

在深度强化学习(RL)中,学习率在稳定性和性能方面起关键作用,但其最优值会随着环境和策略的演变而变化。标准衰减调度器假设单调收敛,常常与这些动态不匹配,导致过早或延迟的调整。我们引入LRRL,这是一种元学习方法,基于策略性能而非训练步骤动态选择学习率。LRRL适应性地偏好能够提高回报的学习率,即使候选集合中包含导致发散的值也能保持稳健。在Atari和MuJoCo基准测试中,LRRL实现了与调谨基线和标准调度器相当或优于的性能。我们的发现将LRRL定位为适应深度RL中非平稳目标的实用解决方案。

关键词

引用

@article{arxiv.2410.12598,
  title  = {Dynamic Learning Rate for Deep Reinforcement Learning: A Bandit Approach},
  author = {Henrique Donâncio and Antoine Barrier and Leah F. South and Florence Forbes},
  journal= {arXiv preprint arXiv:2410.12598},
  year   = {2025}
}