通过模型扩张实现模型族渐进式训练
计算与语言
2026-03-17 v2
摘要
随着大型语言模型(LLM)在实际应用中获得广泛采用,提供参数规模各异的模型族已成为标准做法,以适应不同的计算需求。传统做法是独立训练模型族中的每个模型,计算成本随模型数量呈加性增长。本文提出一种通过渐进式训练构建模型族的高效方法,即逐步扩大较小模型的规模,以创建完整的模型族。通过在参数规模从 1B 至 8B 的模型族上进行大量实验,我们表明该方法约降低 25% 的总计算成本,同时保持与独立训练的相当性能。此外,依据模型规模灵活调整最大学习率,该方法在各种指标上均优于独立训练。除这些改进之外,该方法还促进了不同模型规模间行为的更好一致性。
引用
@article{arxiv.2504.00623,
title = {Efficient Construction of Model Family through Progressive Training Using Model Expansion},
author = {Kazuki Yano and Sho Takase and Sosuke Kobayashi and Shun Kiyono and Jun Suzuki},
journal= {arXiv preprint arXiv:2504.00623},
year = {2026}
}
备注
17pages, accepted by COLM 2025 as a conference paper