中文

加宽而非加深

机器学习 2021-09-08 v3 人工智能 计算机视觉与模式识别

摘要

近年来,带有残差连接的更多 transformer 模块在各种任务上取得了令人印象深刻的成果。为了在更少可训练参数的情况下获得更好性能,近期方法提出通过参数共享或沿深度进行模型压缩来使模型更浅。然而,较弱的建模能力限制了它们的性能。相比之下,通过引入更多可训练矩阵和参数来加宽会产生一个巨大的模型,需要先进的并行化来进行训练和推理。本文中,我们提出了一种参数高效的框架,即加宽而非加深。具体而言,遵循已有工作,我们采用参数共享沿深度进行压缩。但这样的部署会限制性能。为最大化建模能力,我们沿模型宽度进行扩展,用混合专家 (MoE) 替换前馈网络 (FFN)。在 transformer 模块之间,我们提出使用独立的层归一化以更参数高效的方式变换不同的语义表示,而非共享归一化层。为评估我们即插即用的框架,我们设计了 WideNet 并在流行的计算机视觉和自然语言处理基准上进行了全面实验。在 ImageNet-1K 上,我们的最佳模型以 0.72×0.72 \times 的可训练参数超越 Vision Transformer (ViT) 1.5%1.5\%。使用 0.46×0.46 \times0.13×0.13 \times 的参数,我们的 WideNet 仍分别超越 ViT 和 ViT-MoE 0.8%0.8\%2.1%2.1\%。在四个自然语言处理数据集上,WideNet 平均超越 ALBERT 1.8%1.8\%,并以更少参数超越使用分解嵌入参数化的 BERT 0.8%0.8\%

关键词

引用

@article{arxiv.2107.11817,
  title  = {Go Wider Instead of Deeper},
  author = {Fuzhao Xue and Ziji Shi and Futao Wei and Yuxuan Lou and Yong Liu and Yang You},
  journal= {arXiv preprint arXiv:2107.11817},
  year   = {2021}
}