中文

预测训练再评估曲线以有效制定LLM数据课程

机器学习 2026-02-19 v2 人工智能 计算与语言

摘要

数据课程一直是成功训练大型语言模型(LLM)的关键因素,但决定最优数据安排原则的依据仍不清晰。我们提出了训练再评估曲线(TREC),这是一种诊断工具,用于使用最终模型权重对训练批次进行回顾性评估。TREC描述了已训练模型保留训练数据的能力如何随数据遇到的时间而变化。分析规模从111M到39亿参数的模型的TREC,我们展示,在TREC上的低点放置高质量数据可显著提高性能。重要的是,虽然TREC最初只能在训练后观察到,但我们演示它可以从AdamW的隐式指数移动平均系数中预测,从而实现主动课程设计。通过预测出版训练配方的TREC,我们解释了先前的消融实验并揭示了次优的数据安排。我们还将高质量数据与TREC最小值对齐,以提高在使用9000亿token训练的39亿参数LLM进行持续预训练的效果。

关键词

引用

@article{arxiv.2509.25380,
  title  = {Predicting Training Re-evaluation Curves Enables Effective Data Curriculums for LLMs},
  author = {Shane Bergsma and Nolan Dey and Joel Hestness},
  journal= {arXiv preprint arXiv:2509.25380},
  year   = {2026}
}

备注

ICLR 2026