PoPS:面向深度强化学习的策略剪枝与压缩
机器学习
2023-07-19 v1 人工智能
摘要
近年来深度神经网络(DNNs)在强化学习函数逼近中的成功,推动了深度强化学习(DRL)算法在机器人、计算机游戏、自然语言处理、计算机视觉、感知系统和无线网络等领域的开发。遗憾的是,DNNs存在高计算成本与内存消耗的问题,限制了DRL算法在硬件资源受限系统中的使用。近年来,剪枝算法在降低分类任务中DNNs冗余方面取得了显著成功。然而,现有算法在DRL领域存在性能大幅下降的问题。本文中,我们针对DRL领域剪枝的性能下降问题开发了首个有效解决方案,并建立了一种可行算法,称为策略剪枝与压缩(PoPS),以在获得DNN紧凑表示的同时训练出高性能的DRL模型。该框架基于一种新颖的迭代策略剪枝与压缩方法,在训练DRL模型时利用迁移学习的力量。我们给出了广泛的实验研究,使用流行的Cartpole、Lunar Lander、Pong和Pacman环境证明了PoPS的强劲性能。最后,我们为相关领域的研究人员与开发者开发了开源软件。
引用
@article{arxiv.2001.05012,
title = {PoPS: Policy Pruning and Shrinking for Deep Reinforcement Learning},
author = {Dor Livne and Kobi Cohen},
journal= {arXiv preprint arXiv:2001.05012},
year = {2023}
}
备注
This paper has been accepted for publication in the IEEE Journal of Selected Topics in Signal Processing