深度强化学习中的实时策略蒸馏
机器学习
2020-01-01 v1 人工智能
机器学习
摘要
深度强化学习中的策略蒸馏提供了一种有效的方式,可将控制策略从较大的网络迁移到较小的未训练网络,且性能不会显著下降。然而,策略蒸馏在深度强化学习中尚未得到充分探索,且现有方法计算效率低下,导致蒸馏时间过长。此外,蒸馏过程的有效性仍受限于模型容量。我们提出了一种称为实时策略蒸馏的新蒸馏机制,其中教师模型的训练与向学生模型蒸馏策略同时发生。相应地,教师的最新策略被实时迁移到学生模型。这将蒸馏时间减少到原来的一半甚至更少,并且使得极小的学生模型也能学习到专家水平的技能。我们在 Atari 2600 领域评估了所提出的算法。结果表明,即使在高达 1.7% 的压缩比下,我们的方法也能在大多数游戏中实现完全蒸馏。
引用
@article{arxiv.1912.12630,
title = {Real-time Policy Distillation in Deep Reinforcement Learning},
author = {Yuxiang Sun and Pooyan Fazli},
journal= {arXiv preprint arXiv:1912.12630},
year = {2020}
}
备注
In Proceedings of the Workshop on ML for Systems, Thirty-third Conference on Neural Information Processing Systems (NeurIPS), 2019