中文

Brainformer:以简洁性换取效率

机器学习 2024-04-26 v2 计算与语言

摘要

Transformer是自然语言处理与计算机视觉近期成功的核心。Transformer具有基本统一的骨干网络,其中层在前馈与自注意力之间交替以构建深度网络。在此我们研究这一设计选择,发现具有不同层基元排列的更复杂块可能更高效。利用该洞见,我们开发了名为Brainformer的复杂块,其由多种层组成,如稀疏门控前馈层、稠密前馈层、注意力层,以及多种形式的层归一化与激活函数。Brainformer在质量与效率上均持续优于最先进的稠密与稀疏Transformer。一个每token激活参数80亿的Brainformer模型,相比其GLaM对应模型展现出2倍更快的训练收敛与5倍更快的步长时间。在下游任务评估中,Brainformer经微调后相比参数激活数相近的GLaM取得了高3%的SuperGLUE分数。最后,在少样本评估中,Brainformer大幅优于以NAS衍生的、每token计算量相近的Primer稠密模型。

关键词

引用

@article{arxiv.2306.00008,
  title  = {Brainformers: Trading Simplicity for Efficiency},
  author = {Yanqi Zhou and Nan Du and Yanping Huang and Daiyi Peng and Chang Lan and Da Huang and Siamak Shakeri and David So and Andrew Dai and Yifeng Lu and Zhifeng Chen and Quoc Le and Claire Cui and James Laudon and Jeff Dean},
  journal= {arXiv preprint arXiv:2306.00008},
  year   = {2024}
}