中文

发现最小化强化学习环境

机器学习 2024-06-19 v1

摘要

强化学习(RL)代理通常在相同的环境中进行训练和评估。相反,人类往往在专业化的环境中进行训练后再进行评估,例如在考试前学习教科书。尽管如此,这类专业化训练环境的潜力仍被大大低估,尽管它们有能力显著加快训练速度。合成环境框架的初步步骤就是从这个方向出发,通过元学习神经网络基于马尔可夫决策过程(MDP)的环境来发现环境。最初的方法仅限于toy问题,产生的环境未能 transfer 到未见的RL算法。我们在三个方面扩展了这一方法:首先,我们修改了元学习算法,以发现对超参数配置和学习算法不变的环境;其次,通过利用硬件并行性并在代理的评估 episode 时长上引入课程,我们能够在几个具有挑战性的连续控制问题上取得有竞争力的结果。第三,我们惊讶地发现,情境 bandit 能够训练出transfer良好至评估环境的RL代理,即使该环境是复杂的MDP。因此,我们设置实验以训练合成情境 bandit,这些 bandit 在与合成MDP相当的性能,为评估环境提供了额外的见解,并且可以加快下游应用。

关键词

引用

@article{arxiv.2406.12589,
  title  = {Discovering Minimal Reinforcement Learning Environments},
  author = {Jarek Liesen and Chris Lu and Andrei Lupu and Jakob N. Foerster and Henning Sprekeler and Robert T. Lange},
  journal= {arXiv preprint arXiv:2406.12589},
  year   = {2024}
}

备注

10 pages, 7 figures