中文

面向基于模型的强化学习的智能训练器

机器学习 2019-06-06 v6 人工智能 机器学习

摘要

基于模型的强化学习(MBRL)已被提出作为一种有前景的替代方案,通过利用学习到的模型生成合成数据用于策略训练,以应对标准强化学习(RL)中高采样成本的挑战。然而,MBRL 框架 inherently 受限于联合学习控制策略与配置超参数(例如全局/局部模型、真实与合成数据等)的错综复杂过程。训练过程可能繁琐且成本高昂。在本研究中,我们提出一种“强化之上的强化”(RoR)架构,将错综复杂的任务分解为两层强化学习。内层是标准基于模型的 RL 训练过程环境(TPE),其为底层系统学习控制策略并暴露访问状态、动作和奖励的接口。外层呈现一个称为 AI 训练器的 RL 智能体,为内层 TPE 学习最优超参数配置。这种分解方法提供了实现不同训练器设计的可取灵活性,称为“训练训练者”。在我们的研究中,我们提出并优化两种替代训练器设计:1)单头训练器和 2)多头训练器。我们提出的 RoR 框架在 OpenAI gym 的五个任务(即 Pendulum、Mountain Car、Reacher、Half Cheetah 和 Swimmer)上进行了评估。与另外三种基线算法相比,我们提出的训练训练者算法在自动调优能力上具有竞争力,在事先不知最佳参数设置的情况下最多节省 56% 的预期采样成本。所提出的训练器框架可轻松扩展到其他超参数调优代价高昂的情形。

关键词

引用

@article{arxiv.1805.09496,
  title  = {Intelligent Trainer for Model-Based Reinforcement Learning},
  author = {Yuanlong Li and Linsen Dong and Xin Zhou and Yonggang Wen and Kyle Guan},
  journal= {arXiv preprint arXiv:1805.09496},
  year   = {2019}
}

备注

13 pages