中文

交错环境重置改进大规模并行同策略强化学习

机器学习 2025-11-27 v1

摘要

大规模并行GPU模拟环境通过为同策略强化学习算法(如近端策略优化PPO)提供快速数据收集,加速了强化学习(RL)研究。为最大化吞吐量,通常每次策略更新使用较短的rollout,从而提高了更新数据比(UTD)。然而,我们发现,在此设置下,标准的同步重置会引入有害的非平稳性,扭曲学习信号并破坏训练的稳定性。我们引入了交错重置,这是一种简单而有效的技术,其中环境在任务时间范围内的不同时间点进行初始化和重置。这产生了具有更大时间多样性的训练批次,减少了由同步rollout引起的非平稳性。我们通过说明性的玩具环境,刻画了RL环境能从交错重置中显著受益的维度。随后,我们将此技术应用于具有挑战性的高维机器人环境,实现了显著更高的样本效率、更快的实际收敛速度和更强的最终性能。最后,与朴素的同步rollout相比,该技术在更多并行环境下具有更好的可扩展性。

关键词

引用

@article{arxiv.2511.21011,
  title  = {Staggered Environment Resets Improve Massively Parallel On-Policy Reinforcement Learning},
  author = {Sid Bharthulwar and Stone Tao and Hao Su},
  journal= {arXiv preprint arXiv:2511.21011},
  year   = {2025}
}