中文

使强化学习在 Swimmer 上生效

机器学习 2022-08-26 v3

摘要

SWIMMER 环境是强化学习(RL)中的标准基准。特别地,它常用于比较 RL 方法或将 RL 方法与直接策略搜索方法(如遗传算法或进化策略)相结合的论文中。许多此类论文报告 RL 方法在 SWIMMER 上性能较差,而直接策略搜索方法性能要好得多。在本技术报告中,我们表明 RL 方法在 SWIMMER 上的低性能仅仅源于一个重要超参数——折扣因子——调节不当。此外我们表明,通过将该超参数设为正确的值,此问题可轻松解决。最后,针对一组常用 RL 算法,我们提供了一组利用 Stable Baselines3 库及其 RL Zoo 获得的成功超参数。

关键词

引用

@article{arxiv.2208.07587,
  title  = {Making Reinforcement Learning Work on Swimmer},
  author = {Maël Franceschetti and Coline Lacoux and Ryan Ohouens and Antonin Raffin and Olivier Sigaud},
  journal= {arXiv preprint arXiv:2208.07587},
  year   = {2022}
}