NormFormer:通过额外归一化改进 Transformer 预训练
计算与语言
2021-11-02 v2 人工智能
摘要
在预训练期间,Pre-LayerNorm Transformer 存在梯度幅度不匹配的问题:早期层的梯度远大于后期层的梯度。我们提出的 NormFormer 架构可以缓解这些问题,该架构在每一层添加了三个归一化操作:自注意力后的 Layer Norm、自注意力输出的按头缩放,以及第一个全连接层后的 Layer Norm。这些额外操作产生的计算成本可忽略不计(参数增加 0.4%),但改善了参数量从 1.25 亿到 27 亿的因果语言模型和掩码语言模型的预训练困惑度和下游任务性能。例如,在我们最强的 1.3B 参数基线之上添加 NormFormer,可以快 24% 达到相同的困惑度,或在相同的计算预算下收敛得更好,困惑度降低 0.27。该模型达到 GPT3-Large (1.3B) 零样本性能的速度快了 60%。对于掩码语言建模,NormFormer 将微调后的 GLUE 性能平均提高了 1.9%。训练 NormFormer 模型的代码可在 fairseq 中找到:https://github.com/pytorch/fairseq/tree/main/examples/normformer。
关键词
引用
@article{arxiv.2110.09456,
title = {NormFormer: Improved Transformer Pretraining with Extra Normalization},
author = {Sam Shleifer and Jason Weston and Myle Ott},
journal= {arXiv preprint arXiv:2110.09456},
year = {2021}
}