学习可学习性边缘
机器学习
2026-05-01 v6 人工智能
计算与语言
摘要
强化学习如今已被广泛应用于大型语言模型训练的最后一个阶段,尤其是针对数学问题等推理类任务。通常,模型在单个训练步骤中尝试多个问题,从其成功与失败中学习。然而,我们展示在两个流行算法(PPO 和 VinePPO)上应用于两个广泛使用的数据集期间,许多问题要么被所有尝试所解决——即已被学习——要么被所有尝试所忽视——没有产生有意义的训练信号。为此,我们采用强化学习文献中一种方法——可学习性抽样——应用于 LLM 训练的强化学习阶段。我们的课程优先考虑成功方差高的问题,即有时成功但有时不成功的问题。我们的发现表明,这一课程在多个算法和数据集上一致性地提升了训练性能,为更高效、更有效的 LLM 强化学习指明了道路。
引用
@article{arxiv.2502.12272,
title = {Learning to Reason at the Frontier of Learnability},
author = {Thomas Foster and Anya Sims and Johannes Forkel and Mattie Fellows and Jakob Foerster},
journal= {arXiv preprint arXiv:2502.12272},
year = {2026}
}