重新思考易到难:后训练中课程学习的局限性——针对演绎推理
计算与语言
2026-03-31 v1
摘要
课程学习(Curriculum Learning, CL)源于这样一种直觉:以递增的难度进行学习应有助于更好的泛化。在大型语言模型(LLM)的预训练和后训练中都常见采用课程学习。这种直觉在构式推理任务中尤为引人注目,因为复杂问题由基本推理规则构建而成;然而,课程学习对此类任务的实际影响仍鲜有探讨。我们对课程学习在LLM后训练中的应用进行系统实证研究,采用人工合成的算术和逻辑基准测试,其中难度由推理复杂度而非表面层次的代理因素所刻画。令人惊讶的是,在多个模型家族和课程安排下,我们发现难度排序的序列相对于标准随机抽样,在准确率或响应长度上均未见稳健优势。这种发现在监督微调(SFT)和强化学习(RL)方法中均如此。我们的研究表明,在演绎推理的语境下,训练示例的具体排序在实现构式泛化方面发挥着微乎其微的作用,挑战了课程化后训练的实际效用。
引用
@article{arxiv.2603.27226,
title = {Rethinking Easy-to-Hard: Limits of Curriculum Learning in Post-Training for Deductive Reasoning},
author = {Maximilian Mordig and Andreas Opedal and Weiyang Liu and Bernhard Schölkopf},
journal= {arXiv preprint arXiv:2603.27226},
year = {2026}
}