中文

变形器树状推理后训练中的课程学习可证明效益

机器学习 2026-05-05 v3

摘要

最近的课程技术在 LLM 后训练阶段被观察到在提高推理性能方面优于非课程方法,但对其有效性和局限性的原则性理解仍不完整。为填补这一差距,我们发展了一个抽象的理论框架,并确定了课程后训练产生指数样本复杂度改进的充分条件。为验证该框架,我们将基础模型的 Chain-of-Thought 生成建模为状态条件的自回归推理树,并将课程子任务正式化为要么逐步延长推理视野的深度递增课程,要么逐步移除部分提示的提示递减课程。我们的分析表明,使用两种课程策略的强化学习微调可实现高精度且只需多项式样本复杂度,而非课程方法则遇到指数复杂度瓶颈。我们进一步为测试时扩展建立了类似的保证。实证仿真支持我们的理论发现。代码可在 https://github.com/DakeBU/Curriculum-Post-training 获取。

关键词

引用

@article{arxiv.2511.07372,
  title  = {Provable Benefit of Curriculum in Transformer Tree-Reasoning Post-Training},
  author = {Dake Bu and Wei Huang and Andi Han and Atsushi Nitanda and Hau-San Wong and Qingfu Zhang and Taiji Suzuki},
  journal= {arXiv preprint arXiv:2511.07372},
  year   = {2026}
}

备注

Accepted as a conference paper at 43rd International Conference on Machine Learning (ICML 2026)