中文

深度强化学习网络的在线训练与剪枝

机器学习 2025-07-17 v1 人工智能 机器人学

摘要

已有研究表明,当使用特征提取网络时,扩展强化学习(RL)算法的深度神经网络(NN)可以提升性能,但获得的性能提升是以显著增加计算和内存复杂度为代价的。神经网络剪枝方法已在监督学习中成功应对了这一挑战。然而,它们在 RL 中的应用仍待深入探索。我们提出了一种在先进 RL 方法中集成同步训练与剪枝的方法,特别是针对由在线特征提取器网络(OFENet)增强的 RL 算法。我们的网络被训练以解决 RL 网络权重和缩放网络中每个单元的 0/1 随机变量 ξ\xi 的变分伯努利分布参数的随机优化问题。该随机问题表述引入了正则化项,当某个单元对性能贡献很小时,这些正则化项促使变分参数收敛至 0。在这种情况下,相应的结构被永久停用并从其网络中剪枝。我们提出了一种成本感知、促进稀疏的正则化方案,专为 OFENet 的 DenseNet 架构定制,将相关网络的参数复杂度用这些网络中随机变量的参数表示。然后,在将此成本与正则化项匹配时,与它们相关的众多超参数会被自动选择,有效地将 RL 目标与网络压缩相结合。我们在连续控制基准和 Soft Actor-Critic RL 智能体上评估了我们的方法,证明 OFENet 可以被大幅剪枝且性能损失极小。此外,我们的结果证实,在训练期间剪枝大型网络会产生比从头训练小型网络更高效、性能更高的 RL 智能体。

关键词

引用

@article{arxiv.2507.11975,
  title  = {Online Training and Pruning of Deep Reinforcement Learning Networks},
  author = {Valentin Frank Ingmar Guenter and Athanasios Sideris},
  journal= {arXiv preprint arXiv:2507.11975},
  year   = {2025}
}

备注

25 pages, 5 figures, 4 tables