中文

基于易到难课程的迭代自我提升任务导向理论

机器学习 2026-03-23 v2 机器学习

摘要

迭代自我提升通过对大语言模型(LLM)自身生成的经奖励验证输出进行微调来实现改进。与其经验性成功相比,此生成性迭代过程在实际有限样本环境下的理论基础仍有限。我们通过将每次自我提升建模为对奖励过滤分布进行的最大似然微调,推导了关于预期奖励的有限样本保证。我们的分析揭示了明确的反馈环路:更好的模型会接受更多数据,从而支持持续自我提升,同时解释了此类提升最终的饱和现象。采用任务导向视角,考虑多难度层次的推理任务,我们进一步证明了在模型初始化、任务难度和样本预算满足特定条件时,易到难课程相较于固定任务混合训练可获得更好的保证。我们的分析通过蒙特卡洛模拟以及多个标准数学推理基准测试中的实验得到验证。

关键词

引用

@article{arxiv.2602.10014,
  title  = {A Task-Centric Theory for Iterative Self-Improvement with Easy-to-Hard Curricula},
  author = {Chenruo Liu and Yijun Dong and Yiqiu Shen and Qi Lei},
  journal= {arXiv preprint arXiv:2602.10014},
  year   = {2026}
}