中文

基于自适应课程学习的高效强化微调

机器学习 2026-02-03 v3 计算与语言

摘要

强化微调(RFT)已显示出增强大型语言模型(LLM)数学推理能力的巨大潜力,但往往在样本和计算效率方面不理想,需要大量训练。在本工作中,我们引入 AdaRFT(Adaptive Curriculum Reinforcement Finetuning),通过自适应课程学习显著提高了 RFT 的效率和最终准确率。AdaRFT 根据模型最近的奖励信号动态调整训练问题的难度,确保模型始终在具有挑战性但可解决的任务上训练。这种自适应抽样策略通过维持最佳难度范围来加速学习,避免对过于简单或过于困难的问题进行浪费计算。AdaRFT 只需对标准 RFT 算法(如近端策略优化,PPO)进行轻量级扩展,无需修改奖励函数或模型架构。在竞赛水平的数学数据集上实验表明,AdaRFT 在训练效率和推理性能方面均显著提升。我们在多个数据分布和模型规模上评估了 AdaRFT,显示其将训练时间缩短最高可达 50%,并在准确率上实现显著提升,提供了更可扩展且更有效的 RFT 框架。

关键词

引用

@article{arxiv.2504.05520,
  title  = {Efficient Reinforcement Finetuning via Adaptive Curriculum Learning},
  author = {Taiwei Shi and Yiyang Wu and Linxin Song and Tianyi Zhou and Jieyu Zhao},
  journal= {arXiv preprint arXiv:2504.05520},
  year   = {2026}
}

备注

23 pages, 8 figures, 7 tables