中文

LLM 预训练中基于贝叶斯优化的检查点合并

计算与语言 2025-06-04 v2

摘要

GPT-4 和 Gemini 等大语言模型(LLMs)的快速激增突显了其训练过程中对资源的强烈需求,由于巨大的计算和环境成本,这带来了重大挑战。为缓解这一问题,我们提出在 LLM 预训练中进行检查点合并。该方法利用具有共享训练轨迹的 LLM 检查点,并通过贝叶斯优化在广泛的搜索空间中探索最佳合并权重。通过各种实验,我们证明:(1)我们提出的方法展现出增强预训练的能力,提供了一个以极小成本获得巨大收益的机会;(2)我们提出的方法尽管需要给定的留出数据集,但在不同领域仍表现出强大的泛化能力,这是预训练中的关键方面。

关键词

引用

@article{arxiv.2403.19390,
  title  = {Checkpoint Merging via Bayesian Optimization in LLM Pretraining},
  author = {Deyuan Liu and Zecheng Wang and Bingning Wang and Weipeng Chen and Chunshan Li and Zhiying Tu and Dianhui Chu and Bo Li and Dianbo Sui},
  journal= {arXiv preprint arXiv:2403.19390},
  year   = {2025}
}