中文

如何消费高质量数据?基于质量感知函数扩展规模定律的最优数据调度

机器学习 2026-05-26 v1 人工智能

摘要

高质量数据在大型语言模型(LLM)训练中稀缺,但如何在训练动力学中调度其使用尚缺乏理论指导。我们通过引入数据质量维度,扩展函数规模定律,并求解数据质量与 batch 大小联合调度问题的渐近闭式解。该解揭示了两个 regime 和高质量数据数据的双重作用。在噪声受限 regime 中,高质量数据应作为信号放大器使用:降低 batch 大小可将更干净的数据转化为更多信号,而不会放大噪声。在信号受限 regime 中,它应作为噪声抑制器使用:晚期投放可在不牺牲信号积累的前提下降低终端噪声。现有基于课程风格的管道主要利用第二种作用,即在晚期投放更干净的数据,但因常规衰减方案在高质量数据可用时正好降低更新强度,因而忽略了第一种作用。基于此,我们提出一种用于 LLM 中期训练的 Drop-Stable-Rampup 方法:在质量转换点处降低 batch 大小,保持稳定以积累信号,然后提升以抑制终端噪声。在 15B Mixture-of-Experts 模型上进行的 108B tokens 中期训练实验中,Drop-Stable-Rampup 相对于 Warmup-Stable-Decay(WSD)提升平均准确率 +1.70,相对于 Cosine 衰减提升 +2.98,在数学推理基准测试如 GSM8K(+4.23)和 MATH(+2.80)上获得尤为可观的提升。

关键词

引用

@article{arxiv.2605.25698,
  title  = {How Should LLMs Consume High-Quality Data? Optimal Data Scheduling via Quality-Aware Functional Scaling Laws},
  author = {Zhitao Zhu and Xili Wang and Shizhe Wu and Jiawei Fu and Xiaoqing Liu},
  journal= {arXiv preprint arXiv:2605.25698},
  year   = {2026}
}