面向大语言模型预训练中稀疏前馈网络统一视角的研究
计算与语言
2023-10-25 v3 机器学习
摘要
大型稀疏前馈层(S-FFN)如Mixture-of-Experts(MoE)已被证明在扩展Transformer模型规模以预训练大语言模型方面有效。通过仅根据输入激活部分FFN参数,S-FFN在保持训练与推理成本(以FLOPs计)固定的同时提升了泛化性能。在这项工作中,我们在稀疏神经记忆的通用概念框架下分析了S-FFN的两个主要设计选择:记忆块(又称专家)大小与记忆块选择方法。利用该统一框架,我们比较了几种用于语言建模的S-FFN架构,并提供了关于其相对效能与效率的见解。我们发现了一种更简单的选择方法——Avg-K,它通过块的平均聚合隐藏状态来选择块,在语言模型预训练中相比包括Switch Transformer(Fedus et al., 2021)和HashLayer(Roller et al., 2021)在内的现有MoE架构取得了更低的困惑度。
引用
@article{arxiv.2305.13999,
title = {Towards A Unified View of Sparse Feed-Forward Network in Pretraining Large Language Model},
author = {Zeyu Leo Liu and Tim Dettmers and Xi Victoria Lin and Veselin Stoyanov and Xian Li},
journal= {arXiv preprint arXiv:2305.13999},
year = {2023}
}
备注
Accepted to EMNLP 2023