中文

大规模多样性合成用于中期训练

机器学习 2025-08-05 v1 应用统计

摘要

高质量、知识密集型训练数据的稀缺性阻碍了大型语言模型(LLM)的开发,因为传统语料库提供的资讯有限。以往研究合成并集成与语料库相关的问答(QA)数据以提升模型性能,但面临QA数据可扩展性和知识多样性挑战,尤其在跨域情境中。此外,利用我们设计的学科和难度标注系统,我们探测模型在STEM学科和高难度数据中的缺陷。为克服这些限制,我们提出一种新型多样化管道,用于合成BoostQA—a 1000亿token的大规模QA数据集。我们的合成框架:(1)从异构来源精选种子数据;(2)利用DeepSeek-R1实施STEM聚焦的多年级合成以提升数据多样性和高难度合成以缓解难度退化;(3)通过DeepSeek-V3优化答案以提升输出质量。我们在中期训练中利用BoostQA,作为预训练与后训练之间的阶段,以优化领域特定知识获取并提升数据质量。我们的方法使Llama-3 8B在400亿token的数据集上进行中期训练,实现在MMLU和CMMLU上的平均提升为 12.74%\mathbf{12.74\%},并在12个基准测试中建立SOTA平均性能。BoostQA也表现出鲁棒的可扩展性,随模型规模、数据量和初始FLOPs比例的增大,性能持续提升。

关键词

引用

@article{arxiv.2508.01325,
  title  = {Fusion Sampling Validation in Data Partitioning for Machine Learning},
  author = {Christopher Godwin Udomboso and Caston Sigauke and Ini Adinya},
  journal= {arXiv preprint arXiv:2508.01325},
  year   = {2025}
}

备注

23 pages, 10 figures