一种用于上下文敏感拼写纠正的贝叶斯混合方法
cmp-lg
2008-02-03 v1 计算与语言
摘要
两类方法已被证明可用于解决词汇歧义问题。第一类方法依赖于在歧义目标词附近一定距离内特定词语的出现;第二类方法利用目标词周围的词语模式与词性标注序列。这两种方法具有互补覆盖能力:前者捕捉词汇的"氛围"(话语主题、时态等),后者捕捉局部句法。Yarowsky 利用这种互补性,通过决策列表将两种方法加以结合。其思路是汇集各组成方法所提供的证据,然后应用最强的一条证据来解决目标问题,无论该证据属于何种类型。本文以 Yarowsky 的工作为起点,将决策列表应用于上下文敏感拼写纠正问题。总体而言,决策列表的表现优于任一组成方法。然而,研究发现,若不仅考虑最强的一条证据,而是考虑所有可用证据,还能获得进一步的改进。为此,本文提出了一种基于贝叶斯分类器的新混合方法,并展示了其性能提升。
引用
@article{arxiv.cmp-lg/9606001,
title = {A Bayesian hybrid method for context-sensitive spelling correction},
author = {Andrew R. Golding},
journal= {arXiv preprint arXiv:cmp-lg/9606001},
year = {2008}
}
备注
15 pages