中文

一轮训练足矣

机器学习 2019-06-18 v1 机器学习

摘要

在无监督学习中,与训练不同,收集更多数据并非总是代价高昂的过程。例如,考虑到互联网中网页的数量,通过修改采样方法扩大用于训练GPT-2的40GB WebText并非难事。另一方面,鉴于在该数据集上训练已耗费数万美元,朴素地在更大数据集上训练在成本上并不可行。本文建议,与当前无监督模型训练数十至数百轮的做法不同,仅在更大数据集上训练一轮。此外,我们建议适当调整模型规模与待执行的迭代次数。我们表明,Transformer语言模型的性能以此方式得到显著改善,尤其在原始轮数较大时。例如,以一轮训练替代10轮训练,在我们的设定中相当于墙钟时间1.9至3.3倍的加速,若原始轮数更大则更多。在一轮训练下,不会发生过拟合,正则化方法除拖慢训练外别无作用。并且,测试损失随迭代次数的曲线广泛遵循幂律。我们比较了一轮训练下不同参数量级模型的墙钟训练时间,并表明基于我们所提启发式的大小/迭代调整在我们的案例中带来1至2.7倍加速。结合两种方法,我们实现了3.3至5.1倍加速。最后,我们推测一轮训练与大小/迭代调整的各种启示。特别地,基于我们的分析,我们相信可大幅降低训练BERT与GPT-2等最先进模型的成本,甚至可能达10倍之多。

关键词

引用

@article{arxiv.1906.06669,
  title  = {One Epoch Is All You Need},
  author = {Aran Komatsuzaki},
  journal= {arXiv preprint arXiv:1906.06669},
  year   = {2019}
}