用于语言模型预训练加速 2 倍的掩码结构增长
计算与语言
2024-04-09 v3
摘要
加速大语言模型预训练是当前研究的关键问题。本文中,我们聚焦于通过从小的 Transformer 结构逐步增长到大的结构来加速预训练。与渐进式增长相关的两个主要研究问题是:确定最优增长调度,以及设计高效的增长算子。在增长调度方面,现有工作对各单一维度对调度效率的影响探索不足。关于增长算子,现有方法依赖新权重的初始化来继承知识,且仅实现非严格的函数保持,限制了训练动态的进一步提升。为解决这些问题,我们提出掩码结构增长(MSG),包括(i)涉及所有可能维度的增长调度,以及(ii)独立于新权重初始化、严格保持函数的增长算子。实验表明,MSG 显著快于相关工作:我们在预训练不同类型语言模型时实现了高达 2.2 倍的加速,同时保持可比或更好的下游性能。代码已公开于 https://github.com/cofe-ai/MSG。
引用
@article{arxiv.2305.02869,
title = {Masked Structural Growth for 2x Faster Language Model Pre-training},
author = {Yiqun Yao and Zheng Zhang and Jing Li and Yequan Wang},
journal= {arXiv preprint arXiv:2305.02869},
year = {2024}
}
备注
ICLR 2024 camera ready