硬示例就是唯一所需:在标注预算下最大化GRPO后训练
机器学习
2025-10-15 v4 人工智能
摘要
为语言模型微调收集高质量训练样本成本高昂,在实际预算限制下无法获取大量数据。我们研究了示例难度是否影响GRPO训练效果,通过在多个模型和推理任务上比较不同选择策略(易、中、难、随机)。在最难的10%的样本上训练(即基础模型最常失败的样本)可实现最高达47%的性能提升,而使用易示例仅产生3-15%的最小提升。这是因为GRPO需要产生学习信号的outcome variance;硬示例在训练期间保持混合的成功/失败结果,而易示例迅速收敛到一致的成功,从而消除学习机会。此外,基于硬示例训练的模型在跨域泛化方面表现更优,只有硬训练的模型才能在AIME2025基准上实现有意义的提升。我们的发现提供了明确的指导方针:在受限预算的情况下,优先收集和标注基础模型困扰的样本,因为这些样本在GRPO微调中几乎驱动所有学习价值。
引用
@article{arxiv.2508.14094,
title = {Hard Examples Are All You Need: Maximizing GRPO Post-Training Under Annotation Budgets},
author = {Benjamin Pikus and Pratyush Ranjan Tiwari and Burton Ye},
journal= {arXiv preprint arXiv:2508.14094},
year = {2025}
}