中文

面向深度强化学习的最优策略稀疏化与低秩分解

机器学习 2024-03-12 v1 人工智能

摘要

深度强化学习(DRL)在包括计算机游戏和机器人技术在内的广泛应用中展现出了巨大的前景。然而,训练 DRL 策略会消耗大量的计算资源,导致稠密策略容易产生过拟合。此外,使用稠密 DRL 策略进行推理限制了其实际应用,尤其是在边缘计算中。剪枝和奇异值分解等技术已被用于深度学习模型,以实现稀疏化和模型压缩,从而限制过拟合并减少内存消耗。然而,这些技术导致了次优的性能,并伴随显著的奖励衰减。L1L_1L2L_2 正则化技术已被提出用于神经网络稀疏化和稀疏自编码器开发,但其在 DRL 环境中的实现并不明显。我们提出了一种新颖的 L0L_0 范数正则化技术,使用最优稀疏图对 DRL 策略进行稀疏化,并促进其向低秩分解,同时不产生奖励衰减。我们在五个不同环境(Cartpole-v1、Acrobat-v1、LunarLander-v2、SuperMarioBros-7.1.v0 和 Surgical Robot Learning)中使用多种同策略和异策略算法评估了我们的 L0L_0 范数正则化技术。我们证明,在 SuperMarioBros 环境中,经过 L0L_0 范数正则化的 DRL 策略实现了 93% 的稀疏度,并在进行低秩分解时获得了 70% 的压缩率,同时显著优于稠密策略。此外,在 Surgical Robot Learning 环境中,经过 L0L_0 范数正则化的 DRL 策略实现了 36% 的稀疏化,并在分解为低秩时获得了 46% 的压缩率,同时保持了良好的性能。结果表明,我们用于 DRL 策略稀疏化的定制 L0L_0 范数正则化技术是减少计算资源和限制过拟合的一条有前景的途径。

关键词

引用

@article{arxiv.2403.06313,
  title  = {Optimal Policy Sparsification and Low Rank Decomposition for Deep Reinforcement Learning},
  author = {Vikram Goddla},
  journal= {arXiv preprint arXiv:2403.06313},
  year   = {2024}
}