MMR-GRPO:通过多样性感知奖励重加权加速 GRPO 式训练
机器学习
2026-01-15 v1 人工智能
计算与语言
信息检索
摘要
Group Relative Policy Optimization (GRPO) 已成为训练数学推理模型的标准方法;然而,其依赖每个提示词生成多个完成品的做法导致训练计算成本高昂。虽然最近的工作已减少达到峰值性能所需的训练步数,但由于每步成本的增加,整体 wall-clock 训练时间往往保持不变甚至增加。我们提出 MMR-GRPO,通过整合最大边缘相关性 (Maximal Marginal Relevance) 对奖励进行多样性感知重加权。我们的关键洞察在于,语义上冗余的完成品贡献有限的边缘学习信号;优先考虑多样化解决方案可获得更具信息性的更新,从而加速收敛。对三个模型规模 (1.5B, 7B, 8B)、三个 GRPO 变体以及五个数学推理基准进行大规模评估表明,MMR-GRPO 在实现相当峰值性能的同时,平均需减少 47.9% 的训练步数和 70.2% 的 wall-clock 时间。这些收益在模型、方法和基准之间保持一致。我们将发布代码、训练好的模型以及实验协议。
引用
@article{arxiv.2601.09085,
title = {MMR-GRPO: Accelerating GRPO-Style Training through Diversity-Aware Reward Reweighting},
author = {Kangda Wei and Ruihong Huang},
journal= {arXiv preprint arXiv:2601.09085},
year = {2026}
}