中文

大间隔神经语言模型

计算与语言 2018-08-29 v1

摘要

我们提出了一种用于训练神经语言模型的大间隔准则。传统上,神经语言模型通过在合乎语法的句子上最小化困惑度(PPL)来训练。然而,我们证明在某些任务中 PPL 可能并非最优化的指标,并进一步提出了一种大间隔形式化方法。所提方法旨在从任务特定的意义上扩大“好”句子与“坏”句子之间的间隔。它采用端到端训练,可广泛应用于涉及对生成文本重新打分的任务。与最小 PPL 训练相比,我们的方法在语音识别上获得了高达 1.1 的 WER 降低,在机器翻译上获得了 1.0 的 BLEU 提升。

关键词

引用

@article{arxiv.1808.08987,
  title  = {Large Margin Neural Language Model},
  author = {Jiaji Huang and Yi Li and Wei Ping and Liang Huang},
  journal= {arXiv preprint arXiv:1808.08987},
  year   = {2018}
}

备注

9 pages. Accepted as a long paper in EMNLP2018