MoEBERT:通过重要性引导自适应从 BERT 到混合专家模型
计算与语言
2022-05-02 v2
摘要
预训练语言模型已在各种自然语言处理任务中展现出优越性能。然而,这些模型通常包含数亿参数,由于实际应用中对延迟的要求,这限制了它们的实用性。现有方法通过知识蒸馏训练小型压缩模型。然而,由于模型容量减小,这些小模型相比预训练模型性能显著下降。我们提出 MoEBERT,其使用混合专家(Mixture-of-Experts)结构来增加模型容量和推理速度。我们通过将预训练模型中的前馈神经网络自适应为多个专家来初始化 MoEBERT。如此,预训练模型的表征能力得以大量保留。在推理过程中,仅激活其中一个专家,从而可提升速度。我们还提出一种逐层蒸馏方法来训练 MoEBERT。我们在自然语言理解和问答任务上验证了 MoEBERT 的效率和有效性。结果表明,所提方法优于现有的任务特定蒸馏算法。例如,我们的方法在 MNLI(不匹配)数据集上以超过 2% 的优势超越先前方法。我们的代码公开于 https://github.com/SimiaoZuo/MoEBERT。
引用
@article{arxiv.2204.07675,
title = {MoEBERT: from BERT to Mixture-of-Experts via Importance-Guided Adaptation},
author = {Simiao Zuo and Qingru Zhang and Chen Liang and Pengcheng He and Tuo Zhao and Weizhu Chen},
journal= {arXiv preprint arXiv:2204.07675},
year = {2022}
}
备注
NAACL 2022