样本高效的自动化深度强化学习
机器学习
2021-03-18 v3 机器学习
摘要
尽管在多个领域的挑战性问题上取得了显著进展,由于最先进的深度强化学习(RL)算法对超参数选择敏感,其应用仍然具有挑战性。这种敏感性部分可归因于 RL 问题的非平稳性,可能需要在学习过程的不同阶段使用不同的超参数设置。此外,在 RL 设定下,超参数优化(HPO)需要大量的环境交互,阻碍了 RL 成功案例向实际应用的迁移。在这项工作中,我们解决 RL 中样本高效和动态 HPO 的问题。我们提出一种基于种群的自动化 RL(AutoRL)框架,以元优化任意离策略 RL 算法。在该框架中,我们在训练智能体的同时优化超参数和神经网络架构。通过种群间共享收集的经验,我们大幅提升了元优化的样本效率。我们在 MuJoCo 基准测试套件中使用流行的 TD3 算法进行案例研究,展示了样本高效 AutoRL 方法的能力,与基于种群的训练相比,我们将元优化所需的环境交互数量最多减少了一个数量级。
引用
@article{arxiv.2009.01555,
title = {Sample-Efficient Automated Deep Reinforcement Learning},
author = {Jörg K. H. Franke and Gregor Köhler and André Biedenkapp and Frank Hutter},
journal= {arXiv preprint arXiv:2009.01555},
year = {2021}
}
备注
In Proceedings of the International Conference on Learning Representations (ICLR 2021), 2021