利用动态噪声对比估计改进神经跨维随机场语言模型的训练
计算与语言
2018-07-04 v1 机器学习
摘要
一种全新的整句语言模型——神经跨维随机场语言模型(neural TRF LM)已被提出,其中句子被建模为随机场的集合,势函数由神经网络定义,并已通过噪声对比估计(NCE)成功训练。在本文中,我们扩展 NCE 并提出动态噪声对比估计(DNCE)以解决 NCE 训练中观察到的两个问题。首先,引入动态噪声分布并同时训练以收敛到数据分布。这有助于显著减少 NCE 中使用的噪声样本数并降低训练成本。其次,DNCE 区分来自噪声分布生成的句子与来自数据分布和噪声分布插值生成的句子。这缓解了由训练集稀疏性引起的过拟合问题。借助 DNCE,我们能够在大型语料库(约 8 亿词)与大型词表(约 568 K 词)上成功且高效地训练 neural TRF LM。Neural TRF LM 以更少的参数取得与 LSTM LM 相当的性能,且在句子重打分中快 5x~114x。将 neural TRF LM 与 LSTM LM 及 n-gram LM 插值可进一步降低错误率。
引用
@article{arxiv.1807.00993,
title = {Improved training of neural trans-dimensional random field language models with dynamic noise-contrastive estimation},
author = {Bin Wang and Zhijian Ou},
journal= {arXiv preprint arXiv:1807.00993},
year = {2018}
}
备注
6 pages. Has been submitted to SLT 2018