中文

通过参考引导微调在RL中学习困难问题

机器学习 2026-03-06 v2 计算与语言

摘要

数学推理的强化学习(RL)可能 suffer from reward sparsity:对于具有挑战性的问题,LLM可能无法采样任何正确的轨迹,从而阻止RL获得有意义的正向反馈。同时,往往存在人类编写的参考解与问题一起(例如来自AoPS的问题),但直接在这些解上进行微调没有好处,因为模型通常无法模仿其自身推理分布之外的人类证明。我们引入参考引导微调(Reference-Guided Fine-Tuning, ReGFT),一种简单且有效的方法,利用人类编写的参考解来合成困难问题上的正轨迹,并在RL之前进行训练。对于每个问题,我们提供模型部分参考解,让其生成自己的推理轨迹,确保所得轨迹仍在模型的推理空间内,同时仍能从参考指导中受益。在这些参考引导轨迹上进行微调后训练,增加了可解问题的数量,并产生一个在RL期间接收更多正向奖励的检查点。我们在三个基准测试(AIME24、AIME25、BeyondAIME)上进行实验,ReGFT在监督准确率、加速DAPO训练方面 consistently 均有所改进,并提升了RL的最终性能平台。我们的结果表明,ReGFT有效克服了奖励稀疏性,解锁了更强大的基于RL的数学推理能力。

关键词

引用

@article{arxiv.2603.01223,
  title  = {Learn Hard Problems During RL with Reference Guided Fine-tuning},
  author = {Yangzhen Wu and Shanda Li and Zixin Wen and Xin Zhou and Ameet Talwalkar and Yiming Yang and Wenhao Huang and Tianle Cai},
  journal= {arXiv preprint arXiv:2603.01223},
  year   = {2026}
}

备注

15 pages, 5 figures