论用于渐进式 BERT 训练的 Transformer 增长
计算与语言
2021-07-13 v3 机器学习
摘要
由于大规模语言模型预训练代价过高,已投入大量努力渐进式地训练 BERT——从一个低劣但低成本的模型开始,逐步增长模型以增加计算复杂度。我们的目标是以推进对 Transformer 增长的理解并发现指导渐进式训练的原则。首先,我们发现类似于网络架构搜索,Transformer 增长也偏好复合缩放。具体而言,尽管现有方法仅在单一维度上进行网络增长,我们观察到使用复合增长算子并平衡多个维度(如模型的深度、宽度和输入长度)是有益的。此外,我们通过受控比较探索了各维度上的替代增长算子,以给出算子选择的实用指导。鉴于我们的分析,所提方法将 BERT 基础模型与大型模型的预训练分别加速了 73.6% 和 82.2%,同时取得了可比的性能。
关键词
引用
@article{arxiv.2010.12562,
title = {On the Transformer Growth for Progressive BERT Training},
author = {Xiaotao Gu and Liyuan Liu and Hongkun Yu and Jing Li and Chen Chen and Jiawei Han},
journal= {arXiv preprint arXiv:2010.12562},
year = {2021}
}
备注
NAACL 2021