中文

元数据条件化加速语言模型预训练

计算与语言 2025-06-30 v3

摘要

语言模型预训练语料中呈现出广泛的风格、领域和质量层次,这对于开发通用模型能力至关重要,但高效学习和部署正确行为(即从这些异构数据源中所示的每个行为)则富有挑战性。为此,我们提出了一种新方法,称为元数据条件化后冷却(Metadata Conditioning then Cooldown, MeCo),以在预训练期间包含额外的学习线索。MeCo首先在训练期间提供元数据(例如URL如www..wikipedia..org),随后在仅使用标准文本的冷却阶段中使用,从而使模型即使没有元数据也能正常工作。MeCo在不同模型规模(600M至8B参数)和训练来源(C4、RefinedWeb和DCLM)下显著加快了预训练速度。例如,使用MeCo训练的16亿参数语言模型在使用33%更少数据的情况下,即可匹配标准预训练的下游任务性能。此外,MeCo使我们能够通过在推理提示中以实时或人为制造的元数据进行条件化来引导语言模型:例如,在www..wikipedia..org前置以减少有害生成,或在factquizmaster..com(人为制造)中以提高常见知识任务性能。我们还演示了MeCo与不同类型的元数据(如模型生成的主题)兼容。MeCo极其简单,没有增加计算开销,并在生产更具能力和可调控语言模型方面显示出前景。

关键词

引用

@article{arxiv.2501.01956,
  title  = {Metadata Conditioning Accelerates Language Model Pre-training},
  author = {Tianyu Gao and Alexander Wettig and Luxi He and Yihe Dong and Sadhika Malladi and Danqi Chen},
  journal= {arXiv preprint arXiv:2501.01956},
  year   = {2025}
}

备注

Accepted to ICML 2025. Code available at https://github.com/princeton-pli/MeCo