DeepNet:将 Transformer 扩展至 1,000 层
计算与语言
2022-03-02 v1 机器学习
摘要
在本文中,我们提出了一种简单而有效的方法来稳定极深的 Transformer。具体而言,我们引入了一个新的归一化函数(DeepNorm)来修改 Transformer 中的残差连接,并伴随有理论推导的初始化。深入的理论分析表明,模型更新可以以稳定的方式被限制。所提出的方法结合了两者的优点,即 Post-LN 的良好性能和 Pre-LN 的稳定训练,使 DeepNorm 成为首选的替代方案。我们成功地将 Transformer 扩展至 1,000 层(即 2,500 个注意力和前馈网络子层)而没有困难,这比以前的深度 Transformer 深一个数量级。值得注意的是,在具有 7,482 个翻译方向的多语言基准上,我们具有 3.2B 参数的 200 层模型显著优于具有 12B 参数的 48 层 SOTA 模型 5 个 BLEU 点,这表明了一个有前景的扩展方向。
关键词
引用
@article{arxiv.2203.00555,
title = {DeepNet: Scaling Transformers to 1,000 Layers},
author = {Hongyu Wang and Shuming Ma and Li Dong and Shaohan Huang and Dongdong Zhang and Furu Wei},
journal= {arXiv preprint arXiv:2203.00555},
year = {2022}
}
备注
Work in progress