中文

ModuleFormer:模块化源于混合专家

计算与语言 2023-09-13 v2 人工智能 机器学习

摘要

大语言模型(LLMs)已取得令人瞩目的成果。然而,现有模型训练与部署成本高昂,且难以在预训练数据之外扩展知识而不遗忘先前知识。本文提出一种新的神经网络架构 ModuleFormer,利用模块化来提升大语言模型的效率与灵活性。ModuleFormer 基于稀疏混合专家(SMoE)。与先前基于 SMoE 的模块化语言模型需要领域标注数据来学习特定领域专家不同,ModuleFormer 凭借其新的负载均衡与集中损失,可从未经整理的数据中诱导出模块化。ModuleFormer 是一种模块化架构,包含两类不同模块:新的折棍注意力头(stick-breaking attention heads)与前馈专家。在训练与推理过程中,不同模块依据输入词元条件被稀疏激活。在我们的实验中,我们发现该模块化架构为大预训练语言模型带来三种重要能力:1)效率,由于 ModuleFormer 对每个输入词元仅激活其模块子集,因此能以超过两倍吞吐量实现与稠密 LLM 相同的性能;2)可扩展性,ModuleFormer 比稠密 LLM 更能抵御灾难性遗忘,并可轻松通过新模块扩展以学习训练数据未包含的新知识;3)专门化,微调 ModuleFormer 可使模块子集专门化于微调任务,而与任务无关的模块可轻松剪枝以实现轻量部署。

关键词

引用

@article{arxiv.2306.04640,
  title  = {ModuleFormer: Modularity Emerges from Mixture-of-Experts},
  author = {Yikang Shen and Zheyu Zhang and Tianyou Cao and Shawn Tan and Zhenfang Chen and Chuang Gan},
  journal= {arXiv preprint arXiv:2306.04640},
  year   = {2023}
}