什么才是好的课程?解构数据排序对大语言模型数学推理的影响
机器学习
2025-10-28 v2 人工智能
摘要
课程学习(Curriculum Learning,CL)——将训练数据从易到难排序——已成为提高大语言模型(LLM)推理能力的流行策略。然而, prior work(现有工作)采用不同的难度度量标准和训练设置,留下了若干根本性问题的悬而未决:课程何时有效?是正向还是反向排序更好?答案是否取决于我们衡量的指标?本文通过一个统一的离线评估框架, 将课程难度分解为五个互补维度:问题难度、模型惊讶度、置信度边际、预测不确定性和决策变异性。通过在数学推理基准测试上对 Llama3.1-8B、Mistral-7B 和 Gemma3-4B 进行受控微调实验,我们发现:(i)没有任何课程策略在所有情况下都占优势——正向与反向课程学习的相对有效性取决于模型能力与任务复杂度的联合作用;(ii)即便在同一度量标准下,不同难度水平的样本在不同任务需求下也会产生显著的性能提升;(iii)任务对齐型课程侧重于塑造模型最终的表征与泛化能力,而内部状态型课程则调制模型的置信度和不确定性等内部状态。我们的发现挑战了普适课程策略的观念,提供了在不同模型和任务情景下可操作的指导,且某些度量指标表明,优先关注决策不确定样本可进一步提升学习效果。
引用
@article{arxiv.2510.19099,
title = {What Makes a Good Curriculum? Disentangling the Effects of Data Ordering on LLM Mathematical Reasoning},
author = {Yaning Jia and Chunhui Zhang and Xingjian Diao and Xiangchi Yuan and Zhongyu Ouyang and Chiyu Ma and Soroush Vosoughi},
journal= {arXiv preprint arXiv:2510.19099},
year = {2025}
}
备注
8 pages (main text) + 4 pages (appendix), 4 figures