中文

语言建模中的一些进展

计算与语言 2007-05-23 v1

摘要

过去几年中,发现了许多针对简单三元模型的语言建模改进技术,包括缓存、更高阶的 n 元模型、跳跃、插值 Kneser-Ney 拖尾平滑以及聚类。我们对这些技术的每一种进行了变体探索或对其局限性的研究,包括表明句子混合模型可能具有更大的潜力。尽管这些技术都曾单独被研究,但很少有人将它们组合起来进行研究。我们发现,尤其是在平滑和聚类技术方面,存在显著的相互作用。我们将所有技术组合在一起进行比较,并与无计数截断的 Katz 平滑三元模型进行对比。我们实现了训练数据规模不同情况下,38% 至 50% 的困惑度降低(相当于 1 位信息熵),以及 8.9% 的词错误率降低。我们的困惑度降低率或许是目前与公平基准进行比较时报告的最高水平。这篇论文是该论文的扩展版本;其中包含额外的细节与证明,旨在为语言建模领域的最新进展提供良好的介绍。

关键词

引用

@article{arxiv.cs/0108005,
  title  = {A Bit of Progress in Language Modeling},
  author = {Joshua Goodman},
  journal= {arXiv preprint arXiv:cs/0108005},
  year   = {2007}
}

备注

73 pages, extended version of paper to appear in Computer Speech and Language