Transformer 层注入:高效扩容大型语言模型的新方法
计算与语言
2024-10-16 v1
摘要
本文提出了一种名为 Transformer 层注入 (TLI) 的新方法,用于高效地扩大大型语言模型 (LLM) 的规模,同时最小化计算成本并保持模型性能。模型规模是提高机器学习模型质量的关键因素,TLI 通过降低初始损失、最小化微调需求和保持模型复杂度来解决规模化挑战。我们的方法通过在每 K 层中注入新层来改进传统深度扩容 (DUS) 技术,使隐藏表示能够以最小扰动通过 transformer 块。我们将 TLI 与现有方法(包括混合专家 (MoE) 和 DUS)进行比较,并通过在小型 LLM (LLama3 1B、3B 和 8B) 上的实验验证其效率。结果表明,TLI 获得更好的初始化,需要更少的训练步骤,并在 KoBEST 和 KMCQA 等任务上实现更高的准确率,模型即使在无额外训练的情况下也能有效运行。TLI 在数据效率和成本效益方面均显示出显著优于现有方法的性能。其可扩展性和简单性使其成为扩容基于 transformer 模型的潜在解决方案,潜在可用于将模型规模从 10B 扩展到 405B 参数。
引用
@article{arxiv.2410.11654,
title = {Transformer Layer Injection: A Novel Approach for Efficient Upscaling of Large Language Models},
author = {James Vo},
journal= {arXiv preprint arXiv:2410.11654},
year = {2024}
}