中文

面向强化学习的周期性集成内知识蒸馏

机器学习 2020-02-04 v1 人工智能

摘要

离策略集成强化学习(RL)方法已在一组RL基准任务中展现出令人印象深刻的成果。近期工作表明,在训练前或训练过程中以监督方式直接模仿专家策略,可使RL智能体实现更快的策略改进。受这些近期见解启发,我们提出周期性集成内知识蒸馏(PIEKD)。PIEKD是一种学习框架,使用一组策略在环境中行动,同时通过知识蒸馏在集成内策略间周期性共享知识。我们的实验表明,在若干具有挑战性的MuJoCo基准任务上,PIEKD在样本效率方面优于最先进的RL方法。此外,我们进行了消融研究以更好地理解PIEKD。

关键词

引用

@article{arxiv.2002.00149,
  title  = {Periodic Intra-Ensemble Knowledge Distillation for Reinforcement Learning},
  author = {Zhang-Wei Hong and Prabhat Nagarajan and Guilherme Maeda},
  journal= {arXiv preprint arXiv:2002.00149},
  year   = {2020}
}

备注

8 pages