中文

面向大语言模型版本更新的学习率路径切换训练范式

计算与语言 2024-10-08 v1

摘要

由于不断涌现的新数据,版本更新已成为大语言模型(LLM)不可或缺的需求。大语言模型的版本更新训练范式包括从头预训练(PTFS)和持续预训练(CPT)。初步实验表明,PTFS 实现更好的预训练性能,而 CPT 的训练成本更低。此外,两者的性能和训练成本差距随版本更新而逐渐扩大。为调查这一现象的根本原因, 我们分析了 CPT 两个阶段的学习率调整对版本更新的影响:准备初始化检查点的阶段以及基于该检查点的持续预训练阶段。我们发现,第一阶段较大的学习率以及第二阶段的完整学习率衰减过程对于大语言模型的版本更新至关重要。因此,我们提出了学习率路径切换训练范式。该范式包括一个主路径,其中我们使用最大学习率进行预训练,以及多个分支路径,每个分支路径对应一个新增训练数据的 LLM 更新。广泛的实验表明,我们的范式在有效性和通用性方面都表现出色。特别是,在训练四个 LLM 版本时,我们的范式将总体训练成本降低了 58%,而保持了相当的预训练性能。

关键词

引用

@article{arxiv.2410.04103,
  title  = {A Learning Rate Path Switching Training Paradigm for Version Updates of Large Language Models},
  author = {Zhihao Wang and Shiyu Liu and Jianheng Huang and Zheng Wang and Yixuan Liao and Xiaoxin Chen and Junfeng Yao and Jinsong Su},
  journal= {arXiv preprint arXiv:2410.04103},
  year   = {2024}
}

备注

EMNLP 2024 (main,long paper)