用于强化学习的学习型合成环境与奖励网络
机器学习
2022-02-08 v1 人工智能
摘要
我们引入以神经网络表示的合成环境(SEs)与奖励网络(RNs),作为训练强化学习(RL)智能体的代理环境模型。我们展示了一个仅在 SE 上训练后的智能体能够解决相应的真实环境。SE 通过学习真实环境的状态动态与奖励来充当其完整代理,而 RN 是学习增强或替代奖励的部分代理。我们使用双层优化来演化 SE 与 RN:内层循环训练 RL 智能体,外层循环通过进化策略训练 SE / RN 的参数。我们在一广泛的 RL 算法与经典控制环境上评估了所提出的新概念。在一对一比较中,学习 SE 代理比仅在真实环境上训练智能体需要与真实环境更多的交互。然而,一旦这样的 SE 被学习到,我们无需与真实环境进行任何交互即可训练新智能体。此外,学习到的 SE 代理使我们能以更少的交互训练智能体,同时保持原有任务性能。我们的经验结果表明,SE 通过学习有信息的表示来实现该结果,这些表示将智能体偏向相关状态。而且,我们发现这些代理对超参数变化具有鲁棒性,并且可以迁移至未见过的智能体。
引用
@article{arxiv.2202.02790,
title = {Learning Synthetic Environments and Reward Networks for Reinforcement Learning},
author = {Fabio Ferreira and Thomas Nierhoff and Andreas Saelinger and Frank Hutter},
journal= {arXiv preprint arXiv:2202.02790},
year = {2022}
}