中文

策略蒸馏

机器学习 2016-01-08 v2

摘要

使用深度 Q 网络(DQN)的方法,复杂视觉任务的策略已通过深度强化学习成功学习,但需要相对较大的(特定任务)网络和大量训练才能达到良好的性能。在这项工作中,我们提出了一种名为策略蒸馏的新方法,可用于提取强化学习智能体的策略,并训练一个新网络,该网络在保持专家级表现的同时显著更小且更高效。此外,同一方法可用于将多个特定任务的策略整合为单一策略。我们使用 Atari 环境验证了这些主张,并表明多任务蒸馏智能体优于单任务教师以及联合训练的 DQN 智能体。

关键词

引用

@article{arxiv.1511.06295,
  title  = {Policy Distillation},
  author = {Andrei A. Rusu and Sergio Gomez Colmenarejo and Caglar Gulcehre and Guillaume Desjardins and James Kirkpatrick and Razvan Pascanu and Volodymyr Mnih and Koray Kavukcuoglu and Raia Hadsell},
  journal= {arXiv preprint arXiv:1511.06295},
  year   = {2016}
}

备注

Submitted to ICLR 2016