中文

CMR比例定律:预测语言模型持续预训练的关键混合比

计算与语言 2024-10-08 v2 机器学习

摘要

大型语言模型(LLMs)在多样化任务中表现出色,但常常在专业领域表现不佳,这是由于缺乏领域特定或专有语料库。持续预训练(CPT)通过灌输新的领域特定或专有知识并重放通用语料库来增强LLM能力,以防止灾难性遗忘。然而,通用语料库和领域特定语料库的数据混合比例往往是通过经验方法选择的,导致实际训练效率不佳。在此背景下,我们尝试在CPT的底层重新审视LLM的比例行为,发现损失、混合比例和训练token规模之间存在幂律关系。我们形式化了通用能力与领域特定能力之间的权衡,导致通用语料和领域数据之间的明确的关键混合比例(CMR)。通过找到平衡点,CMR维持模型的通用能力并实现所需的领域迁移,确保资源利用的最高效益。考虑到效率和效果之间的平衡,CMR可被视为最佳混合比例。通过大量实验,我们确认了CMR的可预测性,提出了CMR比例定律并证实了其泛化性。这些发现为优化LLM在专业领域的训练提供了实用指南,确保通用和领域特定性能同时提升,同时高效管理训练资源。

关键词

引用

@article{arxiv.2407.17467,
  title  = {CMR Scaling Law: Predicting Critical Mixture Ratios for Continual Pre-training of Language Models},
  author = {Jiawei Gu and Zacc Yang and Chuanghao Ding and Rui Zhao and Fei Tan},
  journal= {arXiv preprint arXiv:2407.17467},
  year   = {2024}
}

备注

EMNLP 2024 main conference