中文

周期异步:加速 LLM 强化学习的一种在策略方法

机器学习 2026-05-05 v7 人工智能

摘要

自 GRPO 算法提出以来,强化学习 (RL) 已引起越来越多的关注用于 LLM 后训练,但训练效率仍是一个关键挑战。在主流 RL 框架中,推理和训练在同一设备上 co-located,其同步执行防止了并行推理和训练。在本工作中,我们重新审视推理和训练部署分离的策略,提出一个周期性异步框架,将同步 RL 训练转换为异步生产者-消费者管道。通过在每个训练迭代开始时同步模型权重并生成来自相同策略的所有 rollout,所提出的框架仍然是内置的 on-policy 方法——而无需对标准 RL 算法进行任何修改——从而避免了现有异步方法引入的 off-policy 偏差。我们进一步引入一个统一的三模型架构和一个共享提示注意力机制,以支持高效的异步执行并减少冗余计算。在 NPU 平台上的实验显示,异步执行带来约 2 倍的吞吐量提升,此外通过系统级优化还能获得额外收益,显著优于主流 RL 框架在端到端吞吐量上,GPU 平台上加速最高可达 3 倍,进一步确认跨架构的可移植性同时保持可 comparable 的准确性。该框架提供了一个实用的、与算法无关的解决方案,用于可扩展的 RL 后训练,而不牺牲 on-policy 正确性。代码请参见:https://github.com/janelu9/EasyLLM

关键词

引用

@article{arxiv.2511.18871,
  title  = {Periodic Asynchrony: An On-Policy Approach for Accelerating LLM Reinforcement Learning},
  author = {Jian Lu},
  journal= {arXiv preprint arXiv:2511.18871},
  year   = {2026}
}