中文

共享是亲情:基于群体 RL 经验共享的高效 LM 后训练

机器学习 2025-09-11 v1 多智能体系统

摘要

后训练语言模型 (LM) 以强化学习 (RL) 进行微调可提升其复杂推理能力,无需监督式微调,DeepSeek-R1-Zero 已证明这一点。然而,有效地利用 RL 对 LM 需要大量并行以扩大推理规模,这带来了非平凡的技术挑战(如延迟、内存和可靠性问题),以及日益增长的财务成本。我们提出了 Swarm sAmpling Policy Optimization (SAPO),一种完全去中心化且异步的 RL 后训练算法。SAPO 设计用于去中心化的异构计算节点网络,每个节点管理自己的策略模型(s),同时与网络中的其他节点共享 rollout;无需对延迟、模型均质性或硬件作任何假设,节点可选择性地独立运行。因此,该算法避免了 RL 后训练规模化中的常见瓶颈,同时也允许(并甚至鼓励)新的可能性。通过对网络中共享的 rollout 进行采样,它实现了“Aha 时刻”的传播,从而引导学习过程。在本文中,我们在受控实验中表明 SAPO 在累积奖励方面实现了最高可达 94% 的提升。我们还分享了在 Gensyn 社区成员贡献的成千上万节点的网络上进行测试的经验,这些节点在开源演示期间在多样化的硬件和模型上运行该算法。

关键词

引用

@article{arxiv.2509.08721,
  title  = {Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing},
  author = {Jeffrey Amico and Gabriel Passamani Andrade and John Donaghy and Ben Fielding and Tristin Forbus and Harry Grieve and Semih Kara and Jari Kolehmainen and Yihua Lou and Christopher Nies and Edward Phillip Flores Nuño and Diogo Ortega and Shikhar Rastogi and Austin Virts and Matthew J. Wright},
  journal= {arXiv preprint arXiv:2509.08721},
  year   = {2025}
}

备注

14 pages, 6 figures