中文

为自然语言构建概率模型

cmp-lg 2008-02-03 v1 计算与语言

摘要

在本论文中,我们研究了三个涉及语言概率建模的问题:平滑 n 元模型、统计语法归纳和双语句子对齐。这三个问题分别在语言的不同层次上使用模型:分别是词语层面、构成层面和句子层面的模型。我们描述了在每个层次上改进语言建模技术的方法,并超越了现有算法在每个问题上的性能。我们采用三种不同的框架来处理这三个问题,并将每个框架与贝叶斯范式相关联,说明每个框架为给定问题所选择的合理性。最后,我们展示了我们的研究如何解决概率建模中的两个核心问题:稀疏数据问题和隐式结构归纳问题。

关键词

引用

@article{arxiv.cmp-lg/9606014,
  title  = {Building Probabilistic Models for Natural Language},
  author = {Stanley F. Chen},
  journal= {arXiv preprint arXiv:cmp-lg/9606014},
  year   = {2008}
}

备注

162 pages, LaTeX, doctoral dissertation