中文

大规模语言建模:四小时内收敛于40GB文本

机器学习 2018-08-14 v2 计算与语言 机器学习

摘要

近期工作展示了如何在大型图像数据集上快速训练卷积神经网络(CNNs),然后将从这些模型获得的知识迁移到多种任务中。遵循[Radford 2017],在本工作中,我们展示了针对自然语言任务的循环神经网络(RNNs)具有类似的可扩展性与可迁移性。通过利用混合精度算术以及跨128块NVIDIA Tesla V100 GPU分布的32k批大小,我们能够在四小时内对字符级4096维乘性LSTM(mLSTM)进行无监督文本重建训练,遍历40 GB Amazon Reviews数据集3个轮次。该运行时间优于先前工作——后者在相同数据集上训练相同规模与配置一个轮次需耗时一个月。收敛大批量RNN模型可能具有挑战性。近期工作建议将学习率作为批大小的函数进行缩放,但我们发现,简单地按批大小函数缩放学习率会导致该问题显著更差的收敛或立即发散。我们提供了一种学习率调度方案,使我们的模型能够以32k批大小收敛。由于我们的模型在数小时内于Amazon Reviews数据集上收敛,且我们对128块Tesla V100 GPU的计算需求虽可观但 commercially available,本工作将大规模无监督NLP训练向大多数商业应用与深度学习研究者开放。一个模型可以在一夜之间在大多数公开或私有文本数据集上完成训练。

关键词

引用

@article{arxiv.1808.01371,
  title  = {Large Scale Language Modeling: Converging on 40GB of Text in Four Hours},
  author = {Raul Puri and Robert Kirby and Nikolai Yakovenko and Bryan Catanzaro},
  journal= {arXiv preprint arXiv:1808.01371},
  year   = {2018}
}

备注

8 pages; To appear in High Performance Machine Learning Workshop (HPML) 2018