中文

RL$^2$:通过慢速强化学习实现快速强化学习

人工智能 2016-11-11 v2 机器学习 神经与进化计算 机器学习

摘要

深度强化学习(deep RL)已成功用于自动学习复杂行为;然而,学习过程需要海量试验。相比之下,动物仅需少量试验即可学习新任务,这得益于它们关于世界的先验知识。本文旨在弥合这一差距。我们不去设计一种“快速”的强化学习算法,而是提议将其表示为一个循环神经网络(RNN)并从数据中学习。在我们提出的方法RL2^2中,该算法被编码在RNN的权重中,这些权重通过一个通用(“慢速”)RL算法缓慢学习得到。RNN接收典型RL算法会接收的所有信息,包括观测、动作、奖励和终止标志;并且它在给定马尔可夫决策过程(MDP)的各回合间保持自身状态。RNN的激活值存储了“快速”RL算法在当前(先前未见的)MDP上的状态。我们在小规模与大规模问题上对RL2^2进行了实验评估。在小规模方面,我们训练它解决随机生成的多臂老虎机问题与有限MDP。RL2^2训练后,其在新MDP上的性能接近于具有最优性保证的人工设计算法。在大规模方面,我们在基于视觉的导航任务上测试了RL2^2,表明它可扩展到高维问题。

关键词

引用

@article{arxiv.1611.02779,
  title  = {RL$^2$: Fast Reinforcement Learning via Slow Reinforcement Learning},
  author = {Yan Duan and John Schulman and Xi Chen and Peter L. Bartlett and Ilya Sutskever and Pieter Abbeel},
  journal= {arXiv preprint arXiv:1611.02779},
  year   = {2016}
}

备注

14 pages. Under review as a conference paper at ICLR 2017