中文

面向非均匀模型协作的 GRPO 训练方法——F-TIS

机器学习 2026-05-22 v1

摘要

强化学习方法如 GRPO 在 LLM 后训练中备受推崇。在 GRPO 中,模型会针对一组提示生成完成项,并对这些完成项进行奖励,以此引导策略朝较高奖励的完成项方向更新。由于模型的自回归特性,这类训练风格的生成阶段可能极其耗时。为此,先前研究尝试在众多节点上分布式执行推理步骤,实现并行计算。这些方法主要假设训练中使用的模型是均匀的,以保持样本尽可能接近于 on-policy。但在去中心化系统中,各方可能拥有不同的计算资源和偏好,希望协作完成同一任务。因此,去中心化训练需要能够处理异构模型——即不同模型协作完成同一任务的方案。这会导致训练期间出现的高度 off-policy 样本,而先前研究已指出,off-policy 样本可能损害 GRPO 的收敛性。为实现异构性,我们提出过滤截断重要性抽样(F-TIS)——一种可利用 off-policy 样本提升本地模型学习能力的 GRPO 风格训练范式。我们的框架允许各种模型在同一 RL 训练运行中协作,同时保持通信效率。我们在各种异构设置下进行了广泛评估,表明其在最终模型收敛性方面与纯粹 on-sample 训练一致。此外,我们在某些设置下观察到其在分布外任务上的泛化能力优于 on-policy 训练,通过提升最高可达 12%。

关键词

引用

@article{arxiv.2605.22537,
  title  = {F-TIS: Harnessing Diverse Models in Collaborative GRPO},
  author = {Nikolay Blagoev and Oğuzhan Ersoy and Wendelin Boehmer and Lydia Yiyu Chen},
  journal= {arXiv preprint arXiv:2605.22537},
  year   = {2026}
}

备注

Accepted to ICML 2026 Workshop Scalable Learning and Optimization for Efficient Multimodal AI Agents (SCALE)