中文

通过失效前缀条件训练饱和问题的推理模型

机器学习 2026-05-12 v2 人工智能 计算与语言

摘要

随着基于可验证奖励的强化学习(RLVR)大幅提升大型语言模型(LLM)的推理能力,一个新瓶颈出现:更多训练问题变得饱和,即 LLM 对几乎每个 rollout 都正确回答问题。在此类问题上,奖励提供的学习信号有限。虽然收集更难的问题是自然的响应,但代价高昂且日益困难。我们提出了失效前缀条件(failure-prefix conditioning),一种简单方法,通过将探索引导至易出错推理状态的方向,从而释放饱和问题中剩余的学习信号。通过对罕见错误轨迹的前缀进行条件化,该方法提高了模型从误导性早期推理中恢复的能力。我们观察到失效前缀条件在标准 RLVR 停滞的地方一致性地提高性能,实现的收益相当于在新收集的中等难度问题上训练。我们进一步分析了模型的鲁棒性,发现该方法减少了在误导性失效前缀下的性能下降,尽管在遵循正确的早期推理方面存在轻微的权衡。最后,我们展示了一种迭代方法,通过在训练期间刷新失效前缀,可在性能平台后获得额外的提升。总体而言,我们的结果表明饱和问题仍包含有价值的学习信号,失效前缀条件提供了一种有效的释放方法。

关键词

引用

@article{arxiv.2601.20829,
  title  = {Training Reasoning Models on Saturated Problems via Failure-Prefix Conditioning},
  author = {Minwu Kim and Safal Shrestha and Anubhav Shrestha and Keith Ross},
  journal= {arXiv preprint arXiv:2601.20829},
  year   = {2026}
}

备注

20 pages