中文

大型语言模型的演化子网络训练

计算与语言 2024-06-12 v1 人工智能

摘要

大型语言模型带来了人工智能研究的新时代。然而,它们巨大的训练成本阻碍了进一步的发展和广泛采用。本文灵感来自大型语言模型参数中的冗余,我们提出一种新颖的训练范式:演化子网络训练(EST)。EST 从大型语言模型的层中抽样子网络,并从每个层中常用的模块(Multi-Head Attention (MHA) 和 Multi-Layer Perceptron (MLP))中抽样。通过逐渐增加子网络的大小来进行训练,EST 能够节省训练成本。我们将 EST 应用于训练 GPT2 模型和 TinyLlama 模型,在 GPT2 上实现了 26.7% 的 FLOPs 节省,在 TinyLlama 上实现了 25.0% 的节省,同时在预训练数据集上没有损失增加。此外,EST 在下游任务上的性能提升表明它有利于泛化。我们提供基于训练动力学和 Dropout 理论的直观理论研究,以确保 EST 的可行性。我们的代码可在 https://github.com/OpenDFM/EST 获取。

关键词

引用

@article{arxiv.2406.06962,
  title  = {Evolving Subnetwork Training for Large Language Models},
  author = {Hanqi Li and Lu Chen and Da Ma and Zijian Wu and Su Zhu and Kai Yu},
  journal= {arXiv preprint arXiv:2406.06962},
  year   = {2024}
}

备注

Accepted to ICML 2024