中文

学习推理课程 I:自适应课程的可证明优势

机器学习 2026-03-20 v1 机器学习

摘要

链式思维推理,其中语言模型在最终响应之前消耗额外计算资源生成思考标记,已推动了模型能力的显著进步。然而,这些推理模型的训练在数据和计算成本方面极其昂贵,因为它涉及来自人类或合成生成器的长期推理行为轨迹,并进一步通过强化学习对模型进行后训练。这些成本是根本性的,还是可以通过更好的算法设计来降低?我们表明,自适应课程(即模型使用自身性能来决定应聚焦的哪些问题)对于标准训练配方(包括监督微调 (SFT) 和强化学习 (RL))均可显著改进。对于 SFT,我们表明,自适应课程比非自适应微调需要指数级更少的推理演示,通过聚焦于当前模型困难的提示来实现。对于 RL 微调,自适应课程将计算成本与参考模型的质量分离,使后者仅需一个近乎独立于目标准确性的烧入成本。这些改进纯源于自适应数据选择,借鉴了提升和反例学习中的经典技术,无需对提示的分布或难度作出假设。

关键词

引用

@article{arxiv.2603.18325,
  title  = {Learning to Reason with Curriculum I: Provable Benefits of Autocurriculum},
  author = {Nived Rajaraman and Audrey Huang and Miro Dudik and Robert Schapire and Dylan J. Foster and Akshay Krishnamurthy},
  journal= {arXiv preprint arXiv:2603.18325},
  year   = {2026}
}

备注

39 pages, 4 figures