INTELLECT-2:通过全球去中心化强化学习训练的推理模型
机器学习
2025-05-13 v1 分布式、并行与集群计算
摘要
我们介绍了 INTELLECT-2,这是第一个进行 320 亿参数语言模型全球分布式强化学习 (RL) 训练运行。不同于传统的集中式训练 effort,INTELLECT-2 使用全异步 RL 在一个 dynamic、heterogeneous 的 permissionless 计算贡献者 swarm 中训练一个推理模型。为 enable 具有该独特基础设施的训练运行,我们从零构建了 various 组件:我们引入了 PRIME-RL,这是为分布式异步强化学习定制的训练框架,基于 novel 组件如 TOPLOC(用于验证来自不可信推理 worker 的 rollout)和 SHARDCAST(高效地将 policy weights 从 training node 广播到推理 worker)。除了基础设施组件,我们提出了对标准 GRPO 训练 recipe 的修改以及 data filtering 技术,这些技术对于实现训练稳定性和确保模型成功学习其训练目标至关重要,从而在 32B 参数范围内提升了 QwQ-32B,这是当今最先进的推理模型。我们开源 INTELLECT-2 及其全部代码和数据,希望鼓励并 enable 更开放的研究,特别是在去中心化训练领域。
引用
@article{arxiv.2505.07291,
title = {INTELLECT-2: A Reasoning Model Trained Through Globally Decentralized Reinforcement Learning},
author = {Prime Intellect Team and Sami Jaghouar and Justus Mattern and Jack Min Ong and Jannik Straube and Manveer Basra and Aaron Pazdera and Kushal Thaman and Matthew Di Ferrante and Felix Gabriel and Fares Obeid and Kemal Erdem and Michael Keiblinger and Johannes Hagemann},
journal= {arXiv preprint arXiv:2505.07291},
year = {2025}
}
备注
26 pages, 12 figures