利用激活稀疏性进行稠密到动态-k 混合专家转换
机器学习
2024-11-13 v4
摘要
Transformer 模型因其高计算需求可能面临实际限制。同时,此类模型表现出显著的激活稀疏性,可利用该性质通过将网络部分转换为等价的混合专家(MoE)层来降低推理成本。尽管激活稀疏性起着关键作用,其对这一过程的影响仍未被探索。我们证明,通过对基础模型的激活稀疏性进行适当正则化,可显著提升转换效率。此外,受不同输入激活神经元数量高方差的启发,我们引入了一种更有效的动态- 专家选择规则,可基于每个 token 调整执行的专家数量。为获得进一步节省,我们将该方法扩展到多头注意力投影。最后,我们开发了高效实现,将这些计算节省转化为实际的时钟时间加速。所提方法——稠密到动态- 混合专家(D2DMoE)——在常见 NLP 与视觉任务上优于现有方法,在不显著影响性能的情况下将推理成本降低多达 60%。
引用
@article{arxiv.2310.04361,
title = {Exploiting Activation Sparsity with Dense to Dynamic-k Mixture-of-Experts Conversion},
author = {Filip Szatkowski and Bartosz Wójcik and Mikołaj Piórczyński and Simone Scardapane},
journal= {arXiv preprint arXiv:2310.04361},
year = {2024}
}