神经语言模型的正则化与非线性:何时需要?
机器学习
2013-06-21 v2 机器学习
摘要
基于循环神经网络(RNN)的神经语言模型(LM)是最成功的词级和字符级语言模型之一。为什么它们表现如此出色,特别是比线性神经语言模型更好?可能的解释是,RNN具有隐式更好的正则化,或者由于其非线性,RNN具有更高的存储模式容量,或者两者兼有。本文论证了在训练数据量很少的极限情况下适用第一种解释,而在大量文本数据情况下适用第二种解释。当使用随机dropout对RNN语言模型进行正则化时,我们在广受欢迎且规模较小的Penn数据集上展示了SOTA性能。尽管如此,我们展示了从一个简化且表达能力弱得多的线性RNN模型(其递归矩阵中没有非对角线项)中获得了更好的性能。我们将此模型称为冲激响应语言模型(IRLM)。使用随机dropout、列归一化和退火学习率,IRLM发展出能够保留过去长达50个词记忆的神经元,并在Penn数据集上实现了102.5的困惑度。然而,在两个大型数据集上,相同的正则化方法对两种模型均不成功,而RNN的表达能力使其困惑度分别比IRLM低10%和20%。尽管存在困惑度差距,IRLM在微软研究院句子补全(MRSC)任务上仍然优于RNN。我们开发了一个稍作修改的IRLM,将长上下文单元(LCU)与短上下文单元分离,并表明仅LCU就在MRSC任务上实现了60.8%的SOTA性能。我们的分析表明,神经语言模型一个富有成效的研究方向在于开发更易访问的内部表示,并建议采用极高动量项的优化方案来有效训练此类模型。
引用
@article{arxiv.1301.5650,
title = {Regularization and nonlinearities for neural language models: when are they needed?},
author = {Marius Pachitariu and Maneesh Sahani},
journal= {arXiv preprint arXiv:1301.5650},
year = {2013}
}
备注
Added new experiments on large datasets and on the Microsoft Research Sentence Completion Challenge