为自然语言构建概率模型
cmp-lg
2008-02-03 v1 计算与语言
摘要
在本论文中,我们研究了三个涉及语言概率建模的问题:平滑 n 元模型、统计语法归纳和双语句子对齐。这三个问题分别在语言的不同层次上使用模型:分别是词语层面、构成层面和句子层面的模型。我们描述了在每个层次上改进语言建模技术的方法,并超越了现有算法在每个问题上的性能。我们采用三种不同的框架来处理这三个问题,并将每个框架与贝叶斯范式相关联,说明每个框架为给定问题所选择的合理性。最后,我们展示了我们的研究如何解决概率建模中的两个核心问题:稀疏数据问题和隐式结构归纳问题。
引用
@article{arxiv.cmp-lg/9606014,
title = {Building Probabilistic Models for Natural Language},
author = {Stanley F. Chen},
journal= {arXiv preprint arXiv:cmp-lg/9606014},
year = {2008}
}
备注
162 pages, LaTeX, doctoral dissertation