同策略并行数据收集对深度强化学习网络的影响
机器学习
2025-06-05 v1 人工智能
摘要
使用并行智能体进行数据收集是强化学习(RL)算法中已被证明有效的技术。这些算法中数据收集的方式受并行环境数量和展开长度的控制,从而引入了一种偏差-方差权衡;另一方面,对收集数据的训练遍数必须在样本效率和过拟合之间取得平衡。我们对PPO——最流行的使用并行智能体的RL算法之一——进行了这些权衡的实证分析,并建立了与网络可塑性以及更广泛地说是优化稳定性的联系。我们考察了其对网络架构的影响,以及在扩展数据时的超参数敏感性。我们的分析表明,更大的数据集规模可以在多种设置下提高最终性能,而扩展并行环境比增加展开长度更有效。这些发现凸显了数据收集策略在提升智能体性能中的关键作用。
引用
@article{arxiv.2506.03404,
title = {The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks},
author = {Walter Mayor and Johan Obando-Ceron and Aaron Courville and Pablo Samuel Castro},
journal= {arXiv preprint arXiv:2506.03404},
year = {2025}
}
备注
Proceedings of the 42nd International Conference on Machine Learning (ICML 2025)