RLx2:从零训练稀疏深度强化学习模型
机器学习
2023-03-09 v2
摘要
训练深度强化学习(DRL)模型通常需高昂计算成本。因此,压缩 DRL 模型在训练加速与模型部署方面极具潜力。然而,现有生成小模型的方法主要采用基于知识蒸馏的迭代训练稠密网络途径,致训练过程仍需求海量计算资源。事实上,DRL 中从零开始的稀疏训练尚未被充分探索,且因自举训练中的非平稳性而尤为困难。本文提出新颖稀疏 DRL 训练框架“Rigged Reinforcement Learning Lottery”(RLx2),其构建于基于梯度的拓扑演化之上,能够完全基于稀疏网络训练稀疏 DRL 模型。具体而言,RLx2 引入带动态容量回放缓冲的多步 TD 目标机制,以在稀疏模型中实现鲁棒价值学习与高效拓扑探索。其在多项任务中达到最优稀疏训练性能,实现 7.5倍-20倍 模型压缩且性能退化小于 3%,训练与推理 FLOPs 分别至多降低 20倍 与 50倍。
引用
@article{arxiv.2205.15043,
title = {RLx2: Training a Sparse Deep Reinforcement Learning Model from Scratch},
author = {Yiqin Tan and Pihe Hu and Ling Pan and Jiatai Huang and Longbo Huang},
journal= {arXiv preprint arXiv:2205.15043},
year = {2023}
}
备注
ICLR 2023 spotlight