探究Transformer语言模型中的低秩训练:效率与规模分析
计算与语言
2024-07-25 v2
摘要
最先进的大型语言模型(LLM)常依赖大规模计算成本,这催生了降低参数数量和成本而不显著影响性能的研究热潮。我们的研究聚焦于基于Transformer的LLM,特别将低秩参数应用于计算密集型前馈网络(FFN),后者比注意力模块更少被人关注。与前期工作不同,我们(i)在规模上探索低秩参数,最高达13亿参数;(ii)针对Transformer语言模型而非卷积架构;(iii)从训练开始即采用低秩方法。在大型RefinedWeb数据集上实验表明,低秩参数在训练中既高效(例如FFN加速2.6倍,参数减少32%)又有效。有趣的是,这些结构化FFN的标度曲线比原始模型更陡。鼓励此发现,我们发展出宽结构化网络,超越当前中等和大型Transformer在困惑度和吞吐量性能方面的表现。我们的代码已公开于 https://github.com/CLAIRE-Labo/StructuredFFN/tree/main。
关键词
引用
@article{arxiv.2407.09835,
title = {Investigating Low-Rank Training in Transformer Language Models: Efficiency and Scaling Analysis},
author = {Xiuying Wei and Skander Moalla and Razvan Pascanu and Caglar Gulcehre},
journal= {arXiv preprint arXiv:2407.09835},
year = {2024}
}
备注
Accepted by ICML 2024 Next Generation of Sequence Modeling Architectures Workshop. Short version of arXiv:2406.16450