学习率衰减浪费了课程化大语言模型预训练中的最佳数据
机器学习
2026-05-15 v3 人工智能
计算与语言
摘要
由于高质量数据稀缺,大型语言模型(LLM)通常在数据质量水平不同的数据混合物上进行训练,即便经过精细的数据筛选。一种自然的做法是通过课程化预训练来更好地利用高质量数据,即按数据质量从小到大排序后的训练。然而, prior研究报道了课程化预训练策略仅有限的改进。本工作识别出限制这些方法的关键因素:升序数据质量顺序与衰减学习率(LR)计划之间的不兼容性。我们发现,尽管在使用恒定学习率时,课程化训练在随机混排时有显著优势,但在标准学习率衰减计划下,其优势却逐渐消失。我们的实验表明,通过两种简单策略可缓解这种不兼容性:(1)采用更温和的学习率衰减计划,即最终学习率仅略小于峰值学习率;(2)用模型平均取代学习率衰减,即对最终几次检查点进行加权平均。通过组合这些策略,我们在多个标准基准测试上的平均得分提升了1.64%,而无需额外的数据精炼。在使用各种数据质量指标,对300亿标记训练的15亿参数模型进行验证后,我们的发现呼吁对课程化大语言模型预训练进行重新评估,并强调了在数据课程与优化方法协同设计方面的潜力。
引用
@article{arxiv.2511.18903,
title = {How Learning Rate Decay Wastes Your Best Data in Curriculum-Based LLM Pretraining},
author = {Kairong Luo and Zhenbo Sun and Haodong Wen and Xinyu Shi and Jiarui Cui and Chenyi Dang and Kaifeng Lyu and Wenguang Chen},
journal= {arXiv preprint arXiv:2511.18903},
year = {2026}
}