语言模型从混合数据中最优划分到专业领域
计算与语言
2026-03-20 v1 机器学习
摘要
语言模型由于预训练数据规模和多样性,在多种知识、语言和推理任务上取得显著性能。标准训练流程为:首先在完整语料库上进行预训练,再在完整语料库的子集中进行高质量专业数据的继续预训练。在多领域设置下,这涉及对每个专业领域进行继续预训练的多个模型,称为 split model training。我们提出一种方法:在通用预训练语料库上独立预训练多个模型,并使用 scaling laws 确定预训练与继续预训练之间的计算资源分配。我们的方法能够准确预测大小为 N 的模型在 D 预训练 token 和 D' 专业化 token 条件下的损失,并推广至更大的模型规模和 token 数量。应用于语言模型训练,我们的方法在不同模型规模和计算预算下, consistently 改善了常识知识和推理基准测试的性能。
关键词
引用
@article{arxiv.2603.19149,
title = {Optimal Splitting of Language Models from Mixtures to Specialized Domains},
author = {Skyler Seto and Pierre Ablin and Anastasiia Filippova and Jiayuan Ye and Louis Bethune and Angelos Katharopoulos and David Grangier},
journal= {arXiv preprint arXiv:2603.19149},
year = {2026}
}
备注
26 pages, 11 tables, 17 figures