BlackOut:利用超大词表加速循环神经网络语言模型
机器学习
2016-04-01 v7 计算与语言
神经与进化计算
机器学习
摘要
我们提出BlackOut,一种用于高效训练具有百万词表的海量循环神经网络语言模型(RNNLMs)的近似算法。BlackOut的动机是使用判别损失,我们描述了一种新的采样策略,该策略在提高稳定性、样本效率和收敛速度的同时显著减少了计算量。理解BlackOut的一种方式是将其视为DropOut策略在输出层的扩展,其中我们使用判别训练损失和加权采样方案。我们还建立了BlackOut、重要性采样和噪声对比估计(NCE)之间的密切联系。我们在最近发布的十亿词语言建模基准上的实验证明了BlackOut的可扩展性和准确性;我们超越了当前最优水平(state-of-the-art),并在该数据集上取得了最低的困惑度分数。此外,不同于其他通常需要GPU或CPU集群的既有方法,我们展示了一个精心实现的BlackOut版本仅需单机1-10天即可在十亿词上训练具有百万词表和十亿参数的RNNLM。尽管我们在RNNLM训练的语境下描述了BlackOut,但它可用于任何具有大型softmax输出层的网络。
引用
@article{arxiv.1511.06909,
title = {BlackOut: Speeding up Recurrent Neural Network Language Models With Very Large Vocabularies},
author = {Shihao Ji and S. V. N. Vishwanathan and Nadathur Satish and Michael J. Anderson and Pradeep Dubey},
journal= {arXiv preprint arXiv:1511.06909},
year = {2016}
}
备注
Published as a conference paper at ICLR 2016