策略蒸馏
机器学习
2016-01-08 v2
摘要
使用深度 Q 网络(DQN)的方法,复杂视觉任务的策略已通过深度强化学习成功学习,但需要相对较大的(特定任务)网络和大量训练才能达到良好的性能。在这项工作中,我们提出了一种名为策略蒸馏的新方法,可用于提取强化学习智能体的策略,并训练一个新网络,该网络在保持专家级表现的同时显著更小且更高效。此外,同一方法可用于将多个特定任务的策略整合为单一策略。我们使用 Atari 环境验证了这些主张,并表明多任务蒸馏智能体优于单任务教师以及联合训练的 DQN 智能体。
引用
@article{arxiv.1511.06295,
title = {Policy Distillation},
author = {Andrei A. Rusu and Sergio Gomez Colmenarejo and Caglar Gulcehre and Guillaume Desjardins and James Kirkpatrick and Razvan Pascanu and Volodymyr Mnih and Koray Kavukcuoglu and Raia Hadsell},
journal= {arXiv preprint arXiv:1511.06295},
year = {2016}
}
备注
Submitted to ICLR 2016