中文

迈向更高效且经济的稀疏激活模型

计算与语言 2021-10-15 v1

摘要

稀疏激活模型通过大规模参数和相对较低的计算成本,在自然语言处理领域取得了巨大成功,并逐渐成为训练和实现超大规模模型的一种可行技术。由于通信成本的限制,在训练和推理过程中激活多个专家几乎难以承受。因此,先前的工作通常每次只激活一个专家,以减轻额外的通信成本。这种路由机制限制了模型性能的上限。在本文中,我们首先研究了一个现象:在更高的稀疏比率下,增加激活专家的数量可以提升模型性能。为了在不增加计算成本的情况下增加激活专家的数量,我们提出了 SAM(Switch and Mixture)路由,这是一种高效的分层路由机制,可在同一设备(GPU)上激活多个专家。我们的方法为超大规模稀疏模型的训练提供了思路,实验证明,我们的模型能够在显著提升效率的同时,实现可观的性能增益。

关键词

引用

@article{arxiv.2110.07431,
  title  = {Towards More Effective and Economic Sparsely-Activated Model},
  author = {Hao Jiang and Ke Zhan and Jianwei Qu and Yongkang Wu and Zhaoye Fei and Xinyu Zhang and Lei Chen and Zhicheng Dou and Xipeng Qiu and Zikai Guo and Ruofei Lai and Jiawen Wu and Enrui Hu and Yinxia Zhang and Yantao Jia and Fan Yu and Zhao Cao},
  journal= {arXiv preprint arXiv:2110.07431},
  year   = {2021}
}