无训练无收益:重访基于 Transformer 的语言模型高效训练算法
机器学习
2023-11-15 v4 人工智能
计算与语言
神经与进化计算
性能
摘要
近年来,训练基于 Transformer 的语言模型所需的计算量急剧攀升。这一趋势催生了旨在比标准训练更快提升训练、验证及下游性能的高效训练算法研究。本工作中,我们重访三类此类算法:动态架构(层堆叠、层丢弃)、批次选择(选择性反向传播、RHO 损失)和高效优化器(Lion、Sophia)。当使用固定计算预算并采用这些方法预训练 BERT 和 T5 时,我们发现其训练、验证和下游收益相较于具有完全衰减学习率的基线均消失。我们定义了一种评估协议,通过将全部计算时间映射到我们称为参考系统时间的参考机器,可在任意机器上完成计算。我们讨论了所提协议的局限性,并发布代码以鼓励对高效训练流程的严谨研究:https://github.com/JeanKaddour/NoTrainNoGain。
引用
@article{arxiv.2307.06440,
title = {No Train No Gain: Revisiting Efficient Training Algorithms For Transformer-based Language Models},
author = {Jean Kaddour and Oscar Key and Piotr Nawrot and Pasquale Minervini and Matt J. Kusner},
journal= {arXiv preprint arXiv:2307.06440},
year = {2023}
}
备注
NeurIPS 2023