BASE层:简化大型稀疏模型的训练
计算与语言
2021-04-01 v1
摘要
我们为大语言模型引入了一种新的平衡专家分配(BASE)层,极大简化了现有的高容量稀疏层。稀疏层通过将每个token路由到仅包含模型参数一小部分的专门专家模块,可显著提升训练和推理效率。然而,学习充分利用可用专家的均衡路由函数可能较为困难;现有方法通常采用路由启发式或辅助专家平衡损失函数。相反,我们将token到专家的分配表述为线性分配问题,从而实现每个专家获得相等数量token的最优分配。该最优分配方案通过保证均衡的计算负载来提高效率,并且由于不需要任何新超参数或辅助损失而简化了训练。代码已在 https://github.com/pytorch/fairseq/ 公开发布。
引用
@article{arxiv.2103.16716,
title = {BASE Layers: Simplifying Training of Large, Sparse Models},
author = {Mike Lewis and Shruti Bhosale and Tim Dettmers and Naman Goyal and Luke Zettlemoyer},
journal= {arXiv preprint arXiv:2103.16716},
year = {2021}
}