面向预训练语言模型的参数高效混合专家架构
计算与语言
2022-10-14 v4 人工智能
机器学习
量子物理
摘要
近年来,混合专家(MoE)架构在提升大规模语言模型的模型容量方面取得了显著成功。然而,MoE需要引入比所扩展的基础模型多得多的参数。在本文中,我们提出通过专家间信息共享来构建参数高效的MoE架构。我们采用矩阵乘积算子(MPO,一种来自量子多体物理的张量分解)来重构专家层中的参数矩阵,并通过在不同专家之间共享中心张量(包含核心信息)的参数,同时通过不同专家的辅助张量(补充中心张量)实现特异性,从而增加预训练语言模型的模型容量。为了解决优化不平衡问题,我们进一步为基于MPO的MoE架构设计了梯度掩码策略。基于T5和GPT-2的大量实验表明,预训练语言模型的性能和效率均得到提升(与Switch Transformers相比,在实现优越模型性能的同时,总参数量减少了27.2倍)。我们的代码已在https://github.com/RUCAIBox/MPOE上公开。
引用
@article{arxiv.2203.01104,
title = {Parameter-Efficient Mixture-of-Experts Architecture for Pre-trained Language Models},
author = {Ze-Feng Gao and Peiyu Liu and Wayne Xin Zhao and Zhong-Yi Lu and Ji-Rong Wen},
journal= {arXiv preprint arXiv:2203.01104},
year = {2022}
}
备注
11 pages, 2 figures, 2 tables