决策中的 DRL 规模化:数据、网络与训练预算策略综述
机器学习
2025-08-06 v1
摘要
近年来,神经网络模型和训练数据的扩大推动了深度学习在计算机视觉和自然语言处理等领域取得显著进展,这一进展以 Scaling Laws 框架为支撑,表明规模化模型参数和训练数据可提升学习性能。尽管这些领域已出现诸如 GPT-4 和 Midjourney 等突破性成果,但将规模化规律应用于深度强化学习 (DRL) 以提升决策能力的研究仍相对不足。本综述系统分析了数据、网络和训练预算三个维度的规模化策略。在数据规模化方面,探讨了通过并行采样和数据生成优化数据效率,考察数据量与学习结果之间的关系。对于网络规模化,研究包括单体扩张、集成与混合专家方法以及智能体数量规模化技术,这些技术共同提升模型表达能力,同时带来独特的计算挑战。最后,在训练预算规模化方面,评估了分布式训练、高回放比率、大批量大小和辅助训练对训练效率和收敛性的影响。通过综合这些策略,本综述不仅强调了这些策略在推动 DRL 决策能力方面的协同作用,还为未来研究提供了路线图。我们强调在计算效率与可扩展性之间进行平衡的重要性,概述了利用规模化潜力实现 DRL 在机器人控制、自动驾驶和大语言模型训练等各种任务中发挥最大作用的前景方向。
引用
@article{arxiv.2508.03194,
title = {Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies},
author = {Yi Ma and Hongyao Tang and Chenjun Xiao and Yaodong Yang and Wei Wei and Jianye Hao and Jiye Liang},
journal= {arXiv preprint arXiv:2508.03194},
year = {2025}
}