一种用于训练大词汇量语言模型的批量噪声对比估计方法
计算与语言
2017-08-23 v2 人工智能
摘要
训练大词汇量神经网络语言模型是一项困难的任务,因为输出层归一化有明确的要求,这通常涉及在整个词汇表上计算完整的 softmax 函数。本文提出了一种批量噪声对比估计方法来缓解这一问题。该方法通过在每个时间步将词汇表缩减为批次中的目标词,然后用噪声对比估计方法替换 softmax 来实现,在这些词中同时扮演目标和噪声样本的角色。如此一来,所提出的方法可以使用优化的稠密矩阵运算来完全表述和实现。将 B-NCE 应用于在 Large Text Compression Benchmark (LTCB) 和 One Billion Word Benchmark (OBWB) 上训练不同的 NNLM,结果显示训练时间显著减少,且模型性能没有明显下降。本文还在单个 Titan-X GPU 上针对大型 OBWB 提供了一项不同标准 NNLM 的新的基线比较研究。
关键词
引用
@article{arxiv.1708.05997,
title = {A Batch Noise Contrastive Estimation Approach for Training Large Vocabulary Language Models},
author = {Youssef Oualil and Dietrich Klakow},
journal= {arXiv preprint arXiv:1708.05997},
year = {2017}
}
备注
Accepted for publication at INTERSPEECH'17