中文

重新思考动态稀疏训练在可扩展深度强化学习中的作用

机器学习 2025-10-15 v1

摘要

规模化神经网络推动了机器学习的突破性进展,但该范式在深度强化学习(DRL)中失败,由于独特的优化路径瘫痪问题,更大的模型往往会降低性能。虽然最近的工作表明,在训练期间动态调整网络拓扑可以缓解这些问题,但现有研究有三个关键局限:(1)对所有模块应用统一的动态训练策略,尽管编码器、批评家和演员遵循不同的学习范式;(2)聚焦于基本架构,未阐明动态训练与架构改进之间的相对重要性和相互作用;(3)缺乏对不同动态方法(包括稀疏到稀疏、稠密到稀疏和稀疏到稠密)的系统性比较。通过对模块和架构进行全面调查,我们揭示了动态稀疏训练策略提供了特定于模块的益处,补充了由架构改进建立的主要可扩展性基础。我们最终将这些见解提炼为模块特定训练(MST)框架,进一步利用架构改进的益处,并在 diverse RL 算法上实现显著的可扩展性提升,无需算法修改。

关键词

引用

@article{arxiv.2510.12096,
  title  = {Rethinking the Role of Dynamic Sparse Training for Scalable Deep Reinforcement Learning},
  author = {Guozheng Ma and Lu Li and Zilin Wang and Haoyu Wang and Shengchao Hu and Leszek Rutkowski and Dacheng Tao},
  journal= {arXiv preprint arXiv:2510.12096},
  year   = {2025}
}