通过扩展至 100 万并行环境防止 PPO 中的学习停滞
机器学习
2026-03-09 v1
摘要
停滞现象(plateau)指智能体性能在亚最优水平上停滞,这是深度基于策略的强化学习中常见的问题。我们聚焦于 PPO 算法,因为其广泛采用。我们指出,某些情景下的停滞并非源于已知的探索、容量或优化挑战,而是源于在训练过程中,基于样本的损失估计最终成为真实目标函数的差差的代理。 PPO 在在线使用当前策略从多个并行环境中采样 rollout(我们称之为外层循环)以及针对该离线数据集进行重复小批量 SGD 步骤(内层循环)之间切换。本文仅关注外层循环,并将其概念性地建模为随机优化问题。此时步长由对前一策略的正则化强度控制,梯度噪声由策略更新步骤之间收集的样本数决定。该模型预测当外层步长相对于噪声过大时,性能将停滞于亚最优水平。将 PPO 在此框架下重新阐述后,可以明确存在两种解决此类学习停滞的方法:要么减小步长,要么增加策略更新步骤之间收集的样本数。我们首先验证了模型的预测,并探讨了超参数选择如何影响步长和更新噪声,得出结论:增加并行环境数量是一种简单且稳健的降低这两个因素的方法。接着,我们提出了在增加并行化时如何协比例调整其他超参数的配方,并展示了错误地进行此类调整会导致严重的性能下降。最终,我们通过将 PPO扩展至超过 100 万个并行环境,在复杂的开放式域中显著超越了先前的基线,从而实现了至 1000 亿个过渡的单调性能提升。
引用
@article{arxiv.2603.06009,
title = {Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments},
author = {Michael Beukman and Khimya Khetarpal and Zeyu Zheng and Will Dabney and Jakob Foerster and Michael Dennis and Clare Lyle},
journal= {arXiv preprint arXiv:2603.06009},
year = {2026}
}