中文

一种用于训练大词汇量语言模型的批量噪声对比估计方法

计算与语言 2017-08-23 v2 人工智能

摘要

训练大词汇量神经网络语言模型是一项困难的任务,因为输出层归一化有明确的要求,这通常涉及在整个词汇表上计算完整的 softmax 函数。本文提出了一种批量噪声对比估计方法来缓解这一问题。该方法通过在每个时间步将词汇表缩减为批次中的目标词,然后用噪声对比估计方法替换 softmax 来实现,在这些词中同时扮演目标和噪声样本的角色。如此一来,所提出的方法可以使用优化的稠密矩阵运算来完全表述和实现。将 B-NCE 应用于在 Large Text Compression Benchmark (LTCB) 和 One Billion Word Benchmark (OBWB) 上训练不同的 NNLM,结果显示训练时间显著减少,且模型性能没有明显下降。本文还在单个 Titan-X GPU 上针对大型 OBWB 提供了一项不同标准 NNLM 的新的基线比较研究。

关键词

引用

@article{arxiv.1708.05997,
  title  = {A Batch Noise Contrastive Estimation Approach for Training Large Vocabulary Language Models},
  author = {Youssef Oualil and Dietrich Klakow},
  journal= {arXiv preprint arXiv:1708.05997},
  year   = {2017}
}

备注

Accepted for publication at INTERSPEECH'17