中文

难度扩展的极限:困难样本在 GRPO 调优的 SLM 中产生递减收益

机器学习 2026-04-09 v1

摘要

关于大型语言模型(LLM)的最新对齐工作表明,偏好优化可以通过将概率质量向更优解转移来改善推理。我们在资源受限的设置下,通过在 GSM8K 和 MATH 数据集上对 SLM(最多 3B)应用带 LoRA 的 GRPO 并进行难度分层分析来检验这一主张。随着问题难度的增加,准确率趋于平稳,揭示了一个容量边界:GRPO 主要重塑输出偏好,而无法可靠地改善最难层级的求解。与之一致的是,仅在较低难度问题上训练 GRPO 可以以仅约 45% 的训练步数达到全数据集在各难度层级的匹配准确率,这表明在此设定下困难样本的收益递减。我们还发现了一种跨数据集泛化效应:GSM8K 训练的 GRPO 在 MATH 的数值子集上达到的准确率高于 MATH 训练的 GRPO,在 1.5B 时超出约 5%,在 3B 时超出约 3%。我们表明,可达到的最佳增益强烈依赖于基础模型的先验推理能力和数据集的难度特征。

关键词

引用

@article{arxiv.2604.06298,
  title  = {Limits of Difficulty Scaling: Hard Samples Yield Diminishing Returns in GRPO-Tuned SLMs},
  author = {Suraj Yadav and Siddharth Yadav and Parth Goyal},
  journal= {arXiv preprint arXiv:2604.06298},
  year   = {2026}
}

备注

Accepted at ICLR Workshop 2026 ICBINB