中文

启动深度强化学习

机器学习 2018-03-13 v1

摘要

我们提出一种利用先前训练的“教师”智能体来启动新“学生”智能体训练的方法。为此,我们借鉴了策略蒸馏与基于种群的训练的思想。我们的方法对教师或学生智能体的架构不加约束,并且能自我调节以使学生智能体在性能上超越其教师。我们表明,在一个具有挑战性且计算密集的多任务基准(DMLab-30)上,启动训练提升了新智能体的数据效率,使对其设计的迭代显著更容易。我们还表明,同一启动流水线可使单个学生智能体利用多个专精于各自任务的“专家”教师。在此设定下启动带来了出乎意料的大幅增益,启动智能体在几乎少 10 倍步数下匹配了从零训练的智能体性能,并超越其最终性能 42%。启动在概念上简单,并可轻易纳入强化学习实验中。

关键词

引用

@article{arxiv.1803.03835,
  title  = {Kickstarting Deep Reinforcement Learning},
  author = {Simon Schmitt and Jonathan J. Hudson and Augustin Zidek and Simon Osindero and Carl Doersch and Wojciech M. Czarnecki and Joel Z. Leibo and Heinrich Kuttler and Andrew Zisserman and Karen Simonyan and S. M. Ali Eslami},
  journal= {arXiv preprint arXiv:1803.03835},
  year   = {2018}
}